Ollama: ejecutar un LLM en local sin APIs de pago (guía 2026)
Mi factura de APIs de IA subía mes tras mes, empujada por tareas que casi me daban vergüenza: resumir artículos de vigilancia, clasificar cientos de palabras clave, preclasificar notas brutas. Pagar precio premium por eso era como alquilar un Ferrari para comprar el pan.
Ollama resuelve este problema concreto: un LLM local gratuito, instalado en cinco minutos, que funciona en una máquina corriente y absorbe las tareas de volumen. He aquí el material que necesitas de verdad, la instalación paso a paso, mis casos de uso diarios y los límites francos del ejercicio.
✨ Resumen Esencial
- Ollama instala y ejecuta modelos open source en local, sin suscripción ni envío de datos a la nube.
- Un ordenador con 8 GB de RAM basta para los modelos compactos; una GPU de 8 GB de VRAM hace fluido el uso interactivo.
- La instalación cabe en un comando en Linux y macOS, en un instalador gráfico en Windows.
- Los buenos casos de uso: resúmenes, clasificación, datos sensibles, tratados por lotes vía la API local.
- La redacción creativa puntera sigue siendo territorio de los grandes modelos cloud: mejor asumir la complementariedad.
Tras varias semanas de uso mixto, mi regla es sencilla: el volumen y lo confidencial en local, la pluma y el razonamiento complejo en la nube. Mi línea de gasto en APIs bajó, mi productividad no se movió. Ese es el verdadero veredicto de este tutorial de Ollama.

El material que hace falta de verdad (y el que te venden para nada)
Los vídeos de marketing prometen LLM locales en un nanordenador de 50 euros. Técnicamente cierto, prácticamente penoso. He aquí la tabla realista que uso cuando asesoro a los emprendedores que acompaño:
| Configuración | Qué da en la práctica | Modelos recomendados |
|---|---|---|
| 8 GB de RAM, sin GPU | Funciona, lentamente. Aceptable para lotes nocturnos | Modelos 3B tipo llama3.2:3b |
| 16 GB de RAM | Zona de confort para un uso diario | Modelos 7B-8B cuantizados tipo llama3.1:8b, mistral |
| GPU de 8 GB de VRAM, o Mac Apple Silicon de 16 GB | Respuestas rápidas, conversación agradable | Modelos 8B, incluso 13B comprimidos |
| GPU de 24 GB de VRAM o más | Terreno de los modelos potentes en local | Modelos de 30B o más |
Tres referencias para orientarte en este vocabulario. La cifra seguida de B indica los miles de millones de parámetros, es decir, a grandes rasgos la capacidad del modelo. Los modelos propuestos por Ollama están cuantizados, o sea comprimidos para caber en la memoria de tu máquina. Y un modelo 8B cuantizado ocupa unos 5 GB en disco: prevé espacio de almacenamiento y la misma cantidad de RAM libre durante la ejecución.
Mi equipo de crucero: un portátil de 16 GB de RAM sin GPU dedicada. Las respuestas llegan a ritmo de lectura rápida, más que suficiente para procesos por lotes lanzados antes de comer. Para conversación interactiva larga, cambio a mis suscripciones cloud, sin remordimientos.
Instalación de Ollama: paso a paso en los tres sistemas
Ve a ollama.com, sección Download, y luego sigue el camino de tu plataforma.
En Linux, basta una sola línea:
«`bash
curl -fsSL https://ollama.com/install.sh | sh
«`
En macOS con Homebrew:
«`bash
brew install ollama
«`
En Windows, descarga el instalador gráfico desde el sitio oficial y haz doble clic. Eso es todo.
Luego comprueba que todo respira correctamente:
«`bash
ollama –version
«`
Después descarga y ejecuta tu primer modelo:
«`bash
ollama pull llama3.2:3b
ollama run llama3.2:3b
«`
El primer comando descarga el modelo, unos minutos según tu conexión. El segundo abre una sesión de chat directamente en la terminal: escribe tu pregunta, conversa y sal limpiamente con `/bye`. Dos comandos prácticos para mantener la vista general:
«`bash
ollama list
ollama ps
«`
Nota práctica fruto de mi instalación de Ollama en tres máquinas distintas: la aplicación funciona en segundo plano tras instalarse en macOS y Windows, y el servicio arranca automáticamente en Linux. Si prefieres una interfaz gráfica, aplicaciones de terceros como Open WebUI se conectan a Ollama, pero la terminal sigue siendo el camino más directo para empezar.
Tres casos de uso solopreneur que rentabilizan la bestia
Caso número 1: el resumen de vigilancia. Cada semana recojo artículos y newsletters en una carpeta dedicada. Un pequeño script en Python envía cada texto a la API local de Ollama y devuelve tres puntos factuales por artículo. Leo cuarenta fuentes resumidas durante mi café de la mañana, sin gastar un céntimo en APIs.
La API local habla HTTP, así que cualquier lenguaje de scripting puede conectarse:
«`bash
curl http://localhost:11434/api/generate -d ‘{
«model»: «llama3.2:3b»,
«prompt»: «Resume este texto en 3 puntos factuales: [tu texto aquí]»,
«stream»: false
}’
«`
Caso número 2: la clasificación en masa. Etiquetar 500 líneas de consultas SEO por intención —informacional, comercial o transaccional— es la tarea perfecta para un modelo 3B. El resultado alimenta después mi hoja de cálculo de clustering. Para el método completo de scripting, detallé mis microautomatizaciones en Python en un artículo dedicado.
Caso número 3: los datos sensibles. Notas personales, cifras de negocio, borradores estratégicos: todo lo que me niego a enviar a un alojador externo pasa por mi modelo de IA local. Nada sale de la máquina, e incluso deja de hacer falta conexión a internet una vez descargados los modelos.
Un extra que se deduce de los anteriores: conectar Ollama a una herramienta de automatización visual como n8n abre la puerta a flujos híbridos, mitad local, mitad nube. Le dedico una guía de n8n pensada para solopreneurs si quieres ver el encadenado completo.

Límites: donde la nube conserva la ventaja
Límite número 1: la pluma. Un modelo local 8B redacta un resumen correcto y un post de LinkedIn normalucho. Para un artículo de fondo en un francés impecable, los grandes modelos alojados en la nube conservan una ventaja neta. Así que hago toda la redacción final del lado cloud, y el preprocesamiento en local.
Límite número 2: la velocidad bruta. Sin GPU, un modelo grande de 30B o más se vuelve penoso en conversación interactiva. El procesamiento por lotes nocturno sigue siendo perfectamente viable, el intercambio en tiempo real no.
Límite número 3: el conocimiento congelado. Un modelo de IA local no sabe nada posterior a su fecha de entrenamiento y no navega por la web por su cuenta. Resume y transforma lo que le das; no va a buscar la información que falta en tu lugar.
Límite número 4: la ventana de contexto. Muchos modelos locales aceptan contextos más cortos que las APIs de gama alta. Los documentos de varios cientos de páginas siguen siendo más fáciles de digerir del lado de los servicios cloud.
Ninguno de estos límites es excluyente si colocas la herramienta en el piso correcto de la casa. Ollama es el obrero del volumen, no la estrella de la redacción. Un LLM local gratuito sobresale justo donde las APIs cuestan caras para poco.
La palabra final
Un LLM local gratuito no sustituye a tu suscripción cloud, absorbe lo que merece quedarse en casa: el volumen repetitivo y lo confidencial. Instala Ollama esta noche, descarga un modelo 3B y pídele resumir tres artículos de vigilancia. Si el ritmo te convence, acabas de recortar una línea de gastos fijos sin perder capacidad.
Mis otros experimentos de campo, materiales probados y scripts completos, están reunidos en la sección Labo.
FAQ: preguntas frecuentes sobre Ollama
¿Es Ollama realmente gratis?
Sí. Ollama es un software de código abierto y los modelos que descarga se publican bajo licencias abiertas. Solo pagas la electricidad que consume tu propia máquina.
¿Qué diferencia hay entre un modelo 3B y un modelo 70B?
La cifra expresa los miles de millones de parámetros del modelo. Cuanto más alta, más capaz es el modelo, pero más RAM o VRAM exige y más lento responde. Para resumir y clasificar, un modelo de 3B a 8B sobra.
¿Se puede usar Ollama sin conexión a internet?
Sí, una vez descargados los modelos. Es una de sus grandes bazas: tus datos se quedan en la máquina y la herramienta funciona totalmente sin conexión, práctico en viaje o con una conexión inestable.
¿Sustituye Ollama a ChatGPT o Claude?
No, y ese no es su papel. Sobresale en las tareas de volumen y confidencialidad, no en la redacción creativa de alto nivel ni en el razonamiento muy complejo. Los dos enfoques se complementan más de lo que se oponen.
¿Qué modelo elegir para empezar?
Empieza con un modelo compacto polivalente como llama3.2:3b. Si tu máquina tiene margen, sube a un modelo 8B como llama3.1:8b o mistral para un mejor nivel de francés.




Deja una respuesta