27 agosto 2026

Ollama: ejecutar un LLM en local sin APIs de pago (guía 2026)

Mi factura de APIs de IA subía mes tras mes, empujada por tareas que casi me daban vergüenza: resumir artículos de vigilancia, clasificar cientos de palabras clave, preclasificar notas brutas. Pagar precio premium por eso era como alquilar un Ferrari para comprar el pan.

Ollama resuelve este problema concreto: un LLM local gratuito, instalado en cinco minutos, que funciona en una máquina corriente y absorbe las tareas de volumen. He aquí el material que necesitas de verdad, la instalación paso a paso, mis casos de uso diarios y los límites francos del ejercicio.

✨ Resumen Esencial

  • Ollama instala y ejecuta modelos open source en local, sin suscripción ni envío de datos a la nube.
  • Un ordenador con 8 GB de RAM basta para los modelos compactos; una GPU de 8 GB de VRAM hace fluido el uso interactivo.
  • La instalación cabe en un comando en Linux y macOS, en un instalador gráfico en Windows.
  • Los buenos casos de uso: resúmenes, clasificación, datos sensibles, tratados por lotes vía la API local.
  • La redacción creativa puntera sigue siendo territorio de los grandes modelos cloud: mejor asumir la complementariedad.

Tras varias semanas de uso mixto, mi regla es sencilla: el volumen y lo confidencial en local, la pluma y el razonamiento complejo en la nube. Mi línea de gasto en APIs bajó, mi productividad no se movió. Ese es el verdadero veredicto de este tutorial de Ollama.

Foto de ambiente de un portátil sobre un escritorio ordenado mostrando una terminal con el comando ollama run generando una respuesta

El material que hace falta de verdad (y el que te venden para nada)

Los vídeos de marketing prometen LLM locales en un nanordenador de 50 euros. Técnicamente cierto, prácticamente penoso. He aquí la tabla realista que uso cuando asesoro a los emprendedores que acompaño:

ConfiguraciónQué da en la prácticaModelos recomendados
8 GB de RAM, sin GPUFunciona, lentamente. Aceptable para lotes nocturnosModelos 3B tipo llama3.2:3b
16 GB de RAMZona de confort para un uso diarioModelos 7B-8B cuantizados tipo llama3.1:8b, mistral
GPU de 8 GB de VRAM, o Mac Apple Silicon de 16 GBRespuestas rápidas, conversación agradableModelos 8B, incluso 13B comprimidos
GPU de 24 GB de VRAM o másTerreno de los modelos potentes en localModelos de 30B o más

Tres referencias para orientarte en este vocabulario. La cifra seguida de B indica los miles de millones de parámetros, es decir, a grandes rasgos la capacidad del modelo. Los modelos propuestos por Ollama están cuantizados, o sea comprimidos para caber en la memoria de tu máquina. Y un modelo 8B cuantizado ocupa unos 5 GB en disco: prevé espacio de almacenamiento y la misma cantidad de RAM libre durante la ejecución.

Mi equipo de crucero: un portátil de 16 GB de RAM sin GPU dedicada. Las respuestas llegan a ritmo de lectura rápida, más que suficiente para procesos por lotes lanzados antes de comer. Para conversación interactiva larga, cambio a mis suscripciones cloud, sin remordimientos.

Instalación de Ollama: paso a paso en los tres sistemas

Ve a ollama.com, sección Download, y luego sigue el camino de tu plataforma.

En Linux, basta una sola línea:

«`bash

curl -fsSL https://ollama.com/install.sh | sh

«`

En macOS con Homebrew:

«`bash

brew install ollama

«`

En Windows, descarga el instalador gráfico desde el sitio oficial y haz doble clic. Eso es todo.

Luego comprueba que todo respira correctamente:

«`bash

ollama –version

«`

Después descarga y ejecuta tu primer modelo:

«`bash

ollama pull llama3.2:3b

ollama run llama3.2:3b

«`

El primer comando descarga el modelo, unos minutos según tu conexión. El segundo abre una sesión de chat directamente en la terminal: escribe tu pregunta, conversa y sal limpiamente con `/bye`. Dos comandos prácticos para mantener la vista general:

«`bash

ollama list

ollama ps

«`

Nota práctica fruto de mi instalación de Ollama en tres máquinas distintas: la aplicación funciona en segundo plano tras instalarse en macOS y Windows, y el servicio arranca automáticamente en Linux. Si prefieres una interfaz gráfica, aplicaciones de terceros como Open WebUI se conectan a Ollama, pero la terminal sigue siendo el camino más directo para empezar.

Tres casos de uso solopreneur que rentabilizan la bestia

Caso número 1: el resumen de vigilancia. Cada semana recojo artículos y newsletters en una carpeta dedicada. Un pequeño script en Python envía cada texto a la API local de Ollama y devuelve tres puntos factuales por artículo. Leo cuarenta fuentes resumidas durante mi café de la mañana, sin gastar un céntimo en APIs.

La API local habla HTTP, así que cualquier lenguaje de scripting puede conectarse:

«`bash

curl http://localhost:11434/api/generate -d ‘{

«model»: «llama3.2:3b»,

«prompt»: «Resume este texto en 3 puntos factuales: [tu texto aquí]»,

«stream»: false

}’

«`

Caso número 2: la clasificación en masa. Etiquetar 500 líneas de consultas SEO por intención —informacional, comercial o transaccional— es la tarea perfecta para un modelo 3B. El resultado alimenta después mi hoja de cálculo de clustering. Para el método completo de scripting, detallé mis microautomatizaciones en Python en un artículo dedicado.

Caso número 3: los datos sensibles. Notas personales, cifras de negocio, borradores estratégicos: todo lo que me niego a enviar a un alojador externo pasa por mi modelo de IA local. Nada sale de la máquina, e incluso deja de hacer falta conexión a internet una vez descargados los modelos.

Un extra que se deduce de los anteriores: conectar Ollama a una herramienta de automatización visual como n8n abre la puerta a flujos híbridos, mitad local, mitad nube. Le dedico una guía de n8n pensada para solopreneurs si quieres ver el encadenado completo.

Esquema de un flujo automatizado: los artículos de vigilancia entran por la izquierda, un modelo local en el centro produce resúmenes, y los resúmenes salen por la derecha hacia una hoja de cálculo

Límites: donde la nube conserva la ventaja

Límite número 1: la pluma. Un modelo local 8B redacta un resumen correcto y un post de LinkedIn normalucho. Para un artículo de fondo en un francés impecable, los grandes modelos alojados en la nube conservan una ventaja neta. Así que hago toda la redacción final del lado cloud, y el preprocesamiento en local.

Límite número 2: la velocidad bruta. Sin GPU, un modelo grande de 30B o más se vuelve penoso en conversación interactiva. El procesamiento por lotes nocturno sigue siendo perfectamente viable, el intercambio en tiempo real no.

Límite número 3: el conocimiento congelado. Un modelo de IA local no sabe nada posterior a su fecha de entrenamiento y no navega por la web por su cuenta. Resume y transforma lo que le das; no va a buscar la información que falta en tu lugar.

Límite número 4: la ventana de contexto. Muchos modelos locales aceptan contextos más cortos que las APIs de gama alta. Los documentos de varios cientos de páginas siguen siendo más fáciles de digerir del lado de los servicios cloud.

Ninguno de estos límites es excluyente si colocas la herramienta en el piso correcto de la casa. Ollama es el obrero del volumen, no la estrella de la redacción. Un LLM local gratuito sobresale justo donde las APIs cuestan caras para poco.

La palabra final

Un LLM local gratuito no sustituye a tu suscripción cloud, absorbe lo que merece quedarse en casa: el volumen repetitivo y lo confidencial. Instala Ollama esta noche, descarga un modelo 3B y pídele resumir tres artículos de vigilancia. Si el ritmo te convence, acabas de recortar una línea de gastos fijos sin perder capacidad.

Mis otros experimentos de campo, materiales probados y scripts completos, están reunidos en la sección Labo.

FAQ: preguntas frecuentes sobre Ollama

¿Es Ollama realmente gratis?

Sí. Ollama es un software de código abierto y los modelos que descarga se publican bajo licencias abiertas. Solo pagas la electricidad que consume tu propia máquina.

¿Qué diferencia hay entre un modelo 3B y un modelo 70B?

La cifra expresa los miles de millones de parámetros del modelo. Cuanto más alta, más capaz es el modelo, pero más RAM o VRAM exige y más lento responde. Para resumir y clasificar, un modelo de 3B a 8B sobra.

¿Se puede usar Ollama sin conexión a internet?

Sí, una vez descargados los modelos. Es una de sus grandes bazas: tus datos se quedan en la máquina y la herramienta funciona totalmente sin conexión, práctico en viaje o con una conexión inestable.

¿Sustituye Ollama a ChatGPT o Claude?

No, y ese no es su papel. Sobresale en las tareas de volumen y confidencialidad, no en la redacción creativa de alto nivel ni en el razonamiento muy complejo. Los dos enfoques se complementan más de lo que se oponen.

¿Qué modelo elegir para empezar?

Empieza con un modelo compacto polivalente como llama3.2:3b. Si tu máquina tiene margen, sube a un modelo 8B como llama3.1:8b o mistral para un mejor nivel de francés.

Laurent, AI Sherpa et créateur YouTube. Diplômé Audencia Business School et Master Sciences de l’Éducation, je propose un écosystème dont le but est de devenir un professionnel augmenté par l’IA, sans subir. Toujours professeur et père de famille expatrié, je partage mon parcours avec transparence pour vous aider à tirer le meilleur de ces nouveaux outils.
Laurent
Fondateur, MintAvocado
Envie d’en apprendre plus ?
Pour aller plus loin sur Mintavocado.com
  • Creation Titres Youtube Seo Algo
    27 agosto 2026

    Título de YouTube: cómo escribir títulos que generan clics

  • Orchestrer Agents Ia
    27 agosto 2026

    Subagentes de IA: orquesta un equipo de agentes sin estudio

  • Mcp server tuto — illustration MCP server tuto : branchez tous vos outils à votre agent IA
    27 agosto 2026

    Tutorial de servidores MCP: conecta todas tus herramientas a tu agente de IA

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *