Al terminar tendrás un modelo de lenguaje funcionando en tu ordenador, sin cuenta y sin clave de API. Sabrás chatear con él, medir su velocidad y llamarlo desde tus propios scripts. Basta un portátil con 8 GB de RAM.
Qué es Ollama
Ollama es un programa de código abierto que descarga modelos de lenguaje y los ejecuta en tu máquina. Por debajo usa los mismos archivos GGUF que llama.cpp, pero te ahorra la compilación y la configuración. Piensa en un camarero: tú pides un plato por su nombre (llama3.1:8b) y él se ocupa de la cocina. Además deja un servidor escuchando en el puerto 11434 de tu propio ordenador, así que cualquier programa tuyo puede usar el modelo.
Qué necesitas
| Tu memoria (RAM o VRAM) | Qué modelo empezar | Tamaño de descarga |
|---|---|---|
| 8 GB | qwen2.5:3b o llama3.2:3b | 1,9 GB y 2,0 GB |
| 16 GB | llama3.1:8b | 4,9 GB |
| 32 GB o más | modelos de 14B a 26B | de 9 a 17 GB |
Los tamaños de descarga salen de ollama.com/library y de nuestro ollama list (consultados el 6-10-2026). La memoria que ocupa un modelo cargado es mayor que su archivo, porque también guarda la conversación. Antes de descargar nada, prueba tu caso en la calculadora de VRAM.
Requisitos del sistema según la documentación oficial (consultada el 6-10-2026):
- Windows: Windows 10 22H2 o posterior. Con tarjeta NVIDIA, drivers 551.61 o posteriores. Unos 4 GB para el programa (docs de Windows).
- macOS: Sonoma (14) o posterior. En un Mac con chip M usa la GPU; en un Mac Intel funciona solo con la CPU (docs de macOS).
- Linux: cualquier distribución moderna. Con NVIDIA necesitas CUDA y que
nvidia-smivea la tarjeta (docs de Linux).
Si aún no tienes la máquina, mira qué hardware recomendamos para cada presupuesto.
Paso 1: instala Ollama
Los comandos vienen del README oficial en GitHub (consultado el 6-10-2026).
Windows. Descarga OllamaSetup.exe y ejecútalo. No pide permisos de administrador. Si prefieres PowerShell:
irm https://ollama.com/install.ps1 | iexmacOS. Descarga el .dmg desde ollama.com/download, abre el archivo y arrastra Ollama a Aplicaciones. Al abrirlo por primera vez te pide crear el comando ollama en el terminal.
Linux. Un solo comando instala el programa y lo deja como servicio de systemd:
curl -fsSL https://ollama.com/install.sh | shComprueba que responde:
ollama --versionEsperado: una línea como ollama version is 0.30.10. Nuestras dos máquinas tienen hoy versiones distintas (0.30.10 y 0.34.0) y los comandos de este artículo funcionan igual en ambas.
Si falla: command not found suele significar que tu terminal no ve todavía el PATH nuevo. Abre otro terminal. En Linux, sudo systemctl status ollama te dice si el servicio está en marcha.
Paso 2: ejecuta tu primer modelo
Con 16 GB o más:
ollama run llama3.1:8bCon 8 GB:
ollama run qwen2.5:3bLa primera vez descarga el modelo y después abre un chat en el terminal. Escribe una pregunta y pulsa Enter. Para salir, escribe /bye.
Si la descarga se corta, repite el mismo comando: continúa donde lo dejó. La primera respuesta tarda más porque el modelo se carga en memoria. En nuestra máquina, esa carga inicial de llama3.1:8b llevó 5,8 segundos y las siguientes 0,21 segundos.
Paso 3: mide la velocidad con —verbose
ollama run llama3.1:8b --verboseTras cada respuesta, Ollama imprime sus tiempos. La línea que importa es eval rate, en tokens por segundo:
load duration: 184.728152ms
prompt eval rate: 518.39 tokens/s
eval count: 8 token(s)
eval rate: 44.63 tokens/sEsa salida es real, de nuestra máquina, con una respuesta de solo 8 tokens. Con respuestas más largas la cifra baja un poco, como verás en la tabla de abajo. Para comparar varios modelos, hazles la misma pregunta con --verbose y compara su eval rate.
Paso 4: los comandos que usarás cada día
| Comando | Qué hace |
|---|---|
ollama list | Lista los modelos descargados y su tamaño. |
ollama ps | Muestra qué modelos están cargados en memoria y dónde corren. |
ollama stop llama3.1:8b | Descarga el modelo de la memoria ahora mismo. |
ollama rm llama3.1:8b | Borra el modelo del disco. |
ollama pull qwen2.5:3b | Descarga un modelo sin abrir el chat. |
ollama show llama3.1:8b | Muestra parámetros, contexto y cuantización. |
Si no usas un modelo, Ollama lo saca de la memoria a los 5 minutos (FAQ oficial). ollama stop lo hace al momento.
Paso 5: llama al modelo desde tu código
El servidor de Ollama escucha en localhost:11434. Este es el formato de la API de chat:
curl http://localhost:11434/api/chat -d '{
"model": "llama3.1:8b",
"stream": false,
"messages": [
{"role": "user", "content": "Explica en tres frases qué es un modelo de lenguaje local."}
]
}'La respuesta es un JSON con el texto en message.content. También trae eval_count (tokens generados) y eval_duration (en nanosegundos). Divide el primero entre el segundo y multiplica por 10⁹ para obtener tokens por segundo.
En Windows, PowerShell trata las comillas de otra forma. Usa curl.exe con el JSON en un archivo, o ejecuta el ejemplo en WSL. Si quieres ver más formas de conectar un modelo local a tus herramientas, la página de desarrolladores las reúne.
Por defecto, el servidor solo acepta conexiones desde tu propia máquina. Antes de abrirlo a tu red, lee nuestra lista de seguridad para Ollama.
Qué medimos
| Máquina | Modelo | Generación | Memoria cargada | Fecha |
|---|---|---|---|---|
| NVIDIA DGX Spark (GB10, 128 GB unificada), Ollama 0.30.10 | llama3.1:8b | 40,5 / 40,9 / 40,8 tok/s en tres llamadas a /api/chat | 9,2 GB, 100% GPU | 6-10-2026 |
| La misma, prueba de referencia publicada | llama3.1:8b | 41,3 tok/s | 9,2 GB | 4-10-2026 |
Los 9,2 GB incluyen una ventana de contexto de 32.768 tokens, que es como tenemos configurado nuestro servidor. Con el valor por defecto de Ollama (4.096 tokens) el mismo archivo ocupó 5,3 GB en nuestra prueba de cuantización. Un portátil irá más lento que esta máquina; por eso conviene que midas el tuyo.
Dónde se guardan los modelos y cómo liberar disco
Según la FAQ oficial:
- macOS:
~/.ollama/models - Linux:
/usr/share/ollama/.ollama/models - Windows:
C:\Users\%username%\.ollama\models
Para liberar espacio, ollama list y después ollama rm con lo que no uses. Para guardar los modelos en otro disco, define la variable de entorno OLLAMA_MODELS y reinicia Ollama. Nuestra carpeta de modelos ocupa 159 GB (medido el 6-10-2026). Nadie la planeó así; se acumula.
Problemas habituales
- El modelo no carga y habla de memoria insuficiente. Elige un modelo más pequeño (de 8B a 3B) o cierra programas que consuman RAM. Un modelo que no cabe no va lento: casi no va.
- La GPU no se usa. Ejecuta
ollama pscon el modelo cargado y mira la columnaPROCESSOR.100% GPUes lo que quieres.100% CPUo un reparto como48%/52% CPU/GPUsignifica que el modelo no cabe entero en la tarjeta o que falta el driver. Prueba un modelo menor y revisa el driver (nvidia-smien Linux y Windows). - Va muy lento en un Mac Intel. Es lo esperado: Ollama solo usa la CPU en esos Mac. Quédate en modelos de 3B.
- Algo falla y no sabes qué. En Linux,
journalctl -e -u ollamamuestra el registro del servicio. En macOS está en~/.ollama/logs.
Cuándo no merece la pena
- Tienes 4 GB de RAM o menos. Los modelos que caben responden peor que cualquier chat gratuito en la nube.
- Necesitas la máxima calidad en razonamiento largo. Un modelo de 8B acierta en resúmenes, borradores y clasificación. Se equivoca más en matemáticas, normativa y cadenas largas de pasos. Para eso, un modelo grande en la nube es la opción honesta.
- Lo usas una vez al mes y tus datos no son sensibles. Lo local gana cuando los datos no pueden salir de tu equipo, cuando el volumen es alto o cuando quieres aprender cómo funciona por dentro.
Próximos pasos
- Compara coste y velocidad frente a la nube: benchmarks de coste nube frente a local.
- Elige el archivo correcto para tu memoria: cuantización GGUF.
- Haz ejercicios guiados en el playground.
Trabaja con nosotros
Si quieres esto funcionando para tu equipo, con el modelo y la máquina medidos sobre tus tareas reales, lo hacemos contigo. Hablemos 15 minutos o mira cómo trabajamos en consultoría.