La respuesta corta (julio de 2026): Ollama (versión actual v0.32.5, 27 de julio de 2026) es una herramienta gratuita y open-source que descarga y ejecuta modelos de lenguaje open-weight en tu propio hardware con un solo comando. Instálala con curl -fsSL https://ollama.com/install.sh | sh en Mac o Linux, o con irm https://ollama.com/install.ps1 | iex en Windows; luego escribe ollama run llama3.2 para empezar a chatear en segundos. Los modelos se ejecutan por completo en tu máquina y nunca la abandonan. La herramienta en sí es gratuita; el plan Pro opcional ($20/mes) te permite enrutar solicitudes a hardware de datacenter para modelos que superen tu RAM o VRAM local.
Última verificación: 29 de julio de 2026, con la documentación oficial y las páginas de precios.
Escrito por Alexis
Qué es Ollama en realidad
Ollama envuelve modelos open-weight en un servidor de inferencia local con una CLI clara y una API REST compatible con OpenAI en http://localhost:11434. Lo instalas una vez, descargas un modelo y tienes de inmediato una interfaz de chat en la terminal o un endpoint de API al que puede conectarse cualquier librería.
La herramienta gestiona automáticamente la selección del formato de cuantización, la asignación de capas en la GPU y el caché de contexto. Los archivos de modelo provienen de ollama.com/library y se almacenan localmente tras la primera descarga. En ejecuciones posteriores, el modelo se carga desde el disco a la VRAM (o a la RAM si no hay GPU) en cuestión de segundos.
Ollama en sí es gratuito y open-source. El nivel Pro de $20/mes es exclusivamente para descargar carga a la nube, no un mecanismo de bloqueo de funciones locales.
Instala Ollama
macOS y Linux:
curl -fsSL https://ollama.com/install.sh | sh
En Linux, esto también instala un servicio systemd para que el servidor de Ollama se ejecute en segundo plano al arrancar.
Windows (PowerShell):
irm https://ollama.com/install.ps1 | iex
También puedes descargar un instalador directo en ollama.com.
Docker:
docker run -d -p 11434:11434 ollama/ollama
Verifica la instalación:
ollama --version
Requisitos de GPU que Ollama verifica al iniciar:
- NVIDIA: compute capability 5.0 o superior, driver 550 o más reciente (driver 570 requerido para tarjetas antiguas con compute 5.0-6.2)
- AMD: ROCm v7 en Linux; el soporte en Windows abarca modelos seleccionados de la serie 7000 y PRO
- Apple Silicon: Metal API, detectada automáticamente
- Vulkan: capa de aceleración de respaldo para GPUs Intel y hardware AMD adicional en Windows y Linux
Si no se detecta ninguna GPU compatible, o si el modelo no cabe en la VRAM, Ollama recurre a la CPU. El resultado es correcto en ambos casos; la inferencia por CPU es considerablemente más lenta.
Ejecuta tu primer modelo
ollama run llama3.2
Esto descarga el tag 3B predeterminado (2.0 GB) si no está disponible localmente y abre un chat interactivo. Escribe /bye para salir.
Ejecuta un tag de tamaño específico:
ollama run llama3.2:1b # 1.3 GB, fast on limited hardware
ollama run gemma3:4b # 3.3 GB, multimodal
ollama run deepseek-r1:7b # 4.7 GB, reasoning model
Envía un prompt puntual sin entrar en la sesión interactiva:
ollama run llama3.2 "Explain the CAP theorem in two sentences"
Pasa una imagen a un modelo multimodal:
ollama run gemma3:4b "Describe this chart. /path/to/chart.png"
Comandos CLI que usarás a diario:
ollama list # models downloaded locally
ollama ps # models currently loaded in memory
ollama pull qwen3:8b # download without opening a chat session
ollama rm qwen3:8b # delete a model from disk
ollama stop gemma3 # unload a model from memory
ollama show llama3.2 # print parameters, template, and license
Elige el modelo adecuado para tu hardware
Ollama usa cuantización Q4 por defecto, lo que reduce el tamaño del archivo frente a FP16. El tamaño del archivo del modelo cuantizado es un indicador fiable de la RAM o VRAM libre que necesitas.
| Model | Tag | File size | RAM/VRAM needed | Strengths |
|---|---|---|---|---|
| gemma3 | gemma3:270m | 292 MB | 1 GB+ | Edge / Raspberry Pi / constrained devices |
| llama3.2 | llama3.2:1b | 1.3 GB | 4 GB+ | Lightweight agents, fast on-device inference |
| llama3.2 | llama3.2:3b | 2.0 GB | 4 GB+ | General chat on laptops with 8 GB RAM |
| qwen3 | qwen3:4b | 2.5 GB | 6 GB+ | Multilingual text, 256K context window |
| gemma3 | gemma3:4b | 3.3 GB | 6 GB+ | Text plus image input on consumer laptops |
| mistral | mistral:7b | 4.4 GB | 8 GB+ | Instruction-following, function calling |
| deepseek-r1 | deepseek-r1:7b | 4.7 GB | 8 GB+ | Reasoning chains, math, logic tasks |
| llama3.1 | llama3.1:8b | 4.9 GB | 8 GB+ | Tool use, 128K context, strong general capability |
| gemma3 | gemma3:12b | 8.1 GB | 12 GB+ | Multimodal reasoning, single mid-range GPU |
| qwen3 | qwen3:14b | 9.3 GB | 12 GB+ | Coding and reasoning on 16 GB cards |
| llama3.1 | llama3.1:70b | 43 GB | 48 GB+ | Production-grade reasoning, multi-GPU rigs |
Cuando un modelo cabe por completo en la VRAM, obtienes el rendimiento total de la GPU. Cuando cabe parcialmente, Ollama descarga las capas sobrantes a la RAM de forma automática; el rendimiento cae de forma proporcional al número de capas procesadas por CPU. Para los modelos que no caben en local a ningún nivel de cuantización, Ollama Cloud puede enrutar las solicitudes a hardware de datacenter.
Usa la API REST local
Ollama se ejecuta en http://localhost:11434 y acepta el mismo formato de solicitudes que la API de OpenAI, por lo que cualquier cliente que admita una URL base personalizada funcionará con él sin cambios en el código.
Genera un completion:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "What is a transformer model?",
"stream": false
}'
Chat con historial de mensajes:
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [
{"role": "user", "content": "Explain attention mechanisms"}
],
"stream": false
}'
Genera embeddings (usa un modelo de embedding dedicado para mejores resultados):
curl http://localhost:11434/api/embed -d '{
"model": "nomic-embed-text",
"input": "The quick brown fox"
}'
Comprueba qué modelos están cargados:
curl http://localhost:11434/api/ps
Usa "stream": true (el valor predeterminado) para recibir la salida token a token como JSON delimitado por saltos de línea. Usa "stream": false para esperar la respuesta completa, lo que simplifica el scripting.
Personaliza modelos con un Modelfile
Un Modelfile incorpora un prompt de sistema, la longitud del contexto y los parámetros de muestreo en un modelo local con nombre. Lo creas una vez y luego ejecutas ollama run my-model con la configuración ya lista.
Crea un archivo llamado Modelfile:
FROM llama3.2
PARAMETER temperature 0.3
PARAMETER num_ctx 8192
SYSTEM """
You are a concise technical assistant. Answer in plain text only.
Show your reasoning step by step before giving the final answer.
"""
Compílalo y ejecútalo:
ollama create my-assistant -f Modelfile
ollama run my-assistant
Parámetros clave que más afectan a la calidad de la salida:
temperature(default 0.8): valores más bajos producen salidas más deterministas; súbelo para tareas creativasnum_ctx(default 2048): ventana de contexto en tokens; auméntalo cuando necesites pegar documentos largos, pero incrementa el uso de VRAMtop_p(default 0.9): controla la diversidad de la salida junto con temperaturerepeat_penalty(default 1.1): reduce los bucles en salidas largas
También puedes compilar desde un archivo GGUF local: FROM ./my-model.gguf. Esta es la ruta a usar si descargaste un modelo directamente desde Hugging Face.
Integra con Python o JavaScript
Ambas librerías oficiales envuelven la API REST con funciones tipadas. Requieren que Ollama esté ejecutándose localmente (o apuntado a un host remoto).
Python (requiere Python 3.8 o superior):
pip install ollama
from ollama import chat
response = chat(
model='llama3.2',
messages=[{'role': 'user', 'content': 'Summarize the halting problem'}]
)
print(response.message.content)
Streaming:
stream = chat(
model='llama3.2',
messages=[{'role': 'user', 'content': 'Write a regex that matches ISO dates'}],
stream=True,
)
for chunk in stream:
print(chunk['message']['content'], end='', flush=True)
JavaScript / TypeScript:
npm i ollama
import ollama from 'ollama'
const response = await ollama.chat({
model: 'llama3.2',
messages: [{ role: 'user', content: 'What is a closure?' }],
})
console.log(response.message.content)
Apunta cualquiera de las dos librerías a un host diferente:
from ollama import Client
client = Client(host='http://192.168.1.10:11434')
const ollama = new Ollama({ host: 'http://192.168.1.10:11434' })
Ambas librerías exponen la superficie completa de la API: chat, generate, embed, pull, rm, list, ps, create, copy, push.
Preguntas frecuentes
¿Ollama puede funcionar sin conexión a internet después de la configuración?
Sí. Una vez que un modelo está descargado en el disco, el servidor de inferencia funciona completamente sin conexión. El proceso ollama serve no se comunica con servidores externos. Solo ollama pull y ollama push requieren conexión de red.
¿Cómo ejecuto Ollama como servicio en segundo plano en Linux?
El script de instalación configura un servicio systemd automáticamente. Comprueba el estado con systemctl status ollama y activa el inicio automático con sudo systemctl enable --now ollama. Si instalaste manualmente, el archivo de unidad del servicio no se crea y tendrás que iniciar ollama serve por tu cuenta.
¿Puedo usar Ollama con LangChain, LlamaIndex u otros frameworks de IA?
Sí. Configura la URL base en tu framework como http://localhost:11434/v1 y usa el nombre de cualquier modelo que hayas descargado. La mayoría de los frameworks que admiten endpoints compatibles con OpenAI no requieren más cambios en el código.
¿Qué ocurre si un modelo es demasiado grande para mi GPU?
Ollama divide el modelo automáticamente, ejecutando en la GPU las capas que caben en VRAM y el resto en CPU. El rendimiento de generación cae de forma proporcional al número de capas procesadas por CPU. La solución práctica es usar un tag de tamaño menor o una variante del modelo entrenada con conciencia de cuantización (QAT), que algunos modelos como gemma3 ofrecen.
¿Cómo veo qué hay en memoria y cómo lo libero?
ollama ps lista los modelos cargados, su huella de memoria y cuánto tiempo llevan activos. Los modelos se descargan automáticamente tras 5 minutos de inactividad por defecto. Fuerza la descarga inmediata con ollama stop <model>.
Si esto te ahorró unas horas de configuración, recibe AI Weekly gratis, 3 ediciones a la semana, leída por más de 40,000 profesionales.