Ver todos los artículos
ollamaia-localllmtutorial

Cómo instalar Ollama y ejecutar tu primer LLM en local

JG
Jacobo González Jaspe
|
Ilustración abstracta: esferas de vidrio anidadas con una luz ámbar en el centro. Modelos
Ilustración generada con IA en nuestra máquina.
Este artículo también está en inglés:How to install Ollama and run your first local LLM

Al terminar tendrás un modelo de lenguaje funcionando en tu ordenador, sin cuenta y sin clave de API. Sabrás chatear con él, medir su velocidad y llamarlo desde tus propios scripts. Basta un portátil con 8 GB de RAM.

Qué es Ollama

Ollama es un programa de código abierto que descarga modelos de lenguaje y los ejecuta en tu máquina. Por debajo usa los mismos archivos GGUF que llama.cpp, pero te ahorra la compilación y la configuración. Piensa en un camarero: tú pides un plato por su nombre (llama3.1:8b) y él se ocupa de la cocina. Además deja un servidor escuchando en el puerto 11434 de tu propio ordenador, así que cualquier programa tuyo puede usar el modelo.

Qué necesitas

Tu memoria (RAM o VRAM)Qué modelo empezarTamaño de descarga
8 GBqwen2.5:3b o llama3.2:3b1,9 GB y 2,0 GB
16 GBllama3.1:8b4,9 GB
32 GB o másmodelos de 14B a 26Bde 9 a 17 GB

Los tamaños de descarga salen de ollama.com/library y de nuestro ollama list (consultados el 6-10-2026). La memoria que ocupa un modelo cargado es mayor que su archivo, porque también guarda la conversación. Antes de descargar nada, prueba tu caso en la calculadora de VRAM.

Requisitos del sistema según la documentación oficial (consultada el 6-10-2026):

  • Windows: Windows 10 22H2 o posterior. Con tarjeta NVIDIA, drivers 551.61 o posteriores. Unos 4 GB para el programa (docs de Windows).
  • macOS: Sonoma (14) o posterior. En un Mac con chip M usa la GPU; en un Mac Intel funciona solo con la CPU (docs de macOS).
  • Linux: cualquier distribución moderna. Con NVIDIA necesitas CUDA y que nvidia-smi vea la tarjeta (docs de Linux).

Si aún no tienes la máquina, mira qué hardware recomendamos para cada presupuesto.

Paso 1: instala Ollama

Los comandos vienen del README oficial en GitHub (consultado el 6-10-2026).

Windows. Descarga OllamaSetup.exe y ejecútalo. No pide permisos de administrador. Si prefieres PowerShell:

PowerShell
irm https://ollama.com/install.ps1 | iex

macOS. Descarga el .dmg desde ollama.com/download, abre el archivo y arrastra Ollama a Aplicaciones. Al abrirlo por primera vez te pide crear el comando ollama en el terminal.

Linux. Un solo comando instala el programa y lo deja como servicio de systemd:

bash
curl -fsSL https://ollama.com/install.sh | sh

Comprueba que responde:

bash
ollama --version

Esperado: una línea como ollama version is 0.30.10. Nuestras dos máquinas tienen hoy versiones distintas (0.30.10 y 0.34.0) y los comandos de este artículo funcionan igual en ambas.

Si falla: command not found suele significar que tu terminal no ve todavía el PATH nuevo. Abre otro terminal. En Linux, sudo systemctl status ollama te dice si el servicio está en marcha.

Paso 2: ejecuta tu primer modelo

Con 16 GB o más:

bash
ollama run llama3.1:8b

Con 8 GB:

bash
ollama run qwen2.5:3b

La primera vez descarga el modelo y después abre un chat en el terminal. Escribe una pregunta y pulsa Enter. Para salir, escribe /bye.

Si la descarga se corta, repite el mismo comando: continúa donde lo dejó. La primera respuesta tarda más porque el modelo se carga en memoria. En nuestra máquina, esa carga inicial de llama3.1:8b llevó 5,8 segundos y las siguientes 0,21 segundos.

Paso 3: mide la velocidad con —verbose

bash
ollama run llama3.1:8b --verbose

Tras cada respuesta, Ollama imprime sus tiempos. La línea que importa es eval rate, en tokens por segundo:

texto
load duration:        184.728152ms
prompt eval rate:     518.39 tokens/s
eval count:           8 token(s)
eval rate:            44.63 tokens/s

Esa salida es real, de nuestra máquina, con una respuesta de solo 8 tokens. Con respuestas más largas la cifra baja un poco, como verás en la tabla de abajo. Para comparar varios modelos, hazles la misma pregunta con --verbose y compara su eval rate.

Paso 4: los comandos que usarás cada día

ComandoQué hace
ollama listLista los modelos descargados y su tamaño.
ollama psMuestra qué modelos están cargados en memoria y dónde corren.
ollama stop llama3.1:8bDescarga el modelo de la memoria ahora mismo.
ollama rm llama3.1:8bBorra el modelo del disco.
ollama pull qwen2.5:3bDescarga un modelo sin abrir el chat.
ollama show llama3.1:8bMuestra parámetros, contexto y cuantización.

Si no usas un modelo, Ollama lo saca de la memoria a los 5 minutos (FAQ oficial). ollama stop lo hace al momento.

Paso 5: llama al modelo desde tu código

El servidor de Ollama escucha en localhost:11434. Este es el formato de la API de chat:

bash
curl http://localhost:11434/api/chat -d '{
  "model": "llama3.1:8b",
  "stream": false,
  "messages": [
    {"role": "user", "content": "Explica en tres frases qué es un modelo de lenguaje local."}
  ]
}'

La respuesta es un JSON con el texto en message.content. También trae eval_count (tokens generados) y eval_duration (en nanosegundos). Divide el primero entre el segundo y multiplica por 10⁹ para obtener tokens por segundo.

En Windows, PowerShell trata las comillas de otra forma. Usa curl.exe con el JSON en un archivo, o ejecuta el ejemplo en WSL. Si quieres ver más formas de conectar un modelo local a tus herramientas, la página de desarrolladores las reúne.

Por defecto, el servidor solo acepta conexiones desde tu propia máquina. Antes de abrirlo a tu red, lee nuestra lista de seguridad para Ollama.

Qué medimos

MáquinaModeloGeneraciónMemoria cargadaFecha
NVIDIA DGX Spark (GB10, 128 GB unificada), Ollama 0.30.10llama3.1:8b40,5 / 40,9 / 40,8 tok/s en tres llamadas a /api/chat9,2 GB, 100% GPU6-10-2026
La misma, prueba de referencia publicadallama3.1:8b41,3 tok/s9,2 GB4-10-2026

Los 9,2 GB incluyen una ventana de contexto de 32.768 tokens, que es como tenemos configurado nuestro servidor. Con el valor por defecto de Ollama (4.096 tokens) el mismo archivo ocupó 5,3 GB en nuestra prueba de cuantización. Un portátil irá más lento que esta máquina; por eso conviene que midas el tuyo.

Dónde se guardan los modelos y cómo liberar disco

Según la FAQ oficial:

  • macOS: ~/.ollama/models
  • Linux: /usr/share/ollama/.ollama/models
  • Windows: C:\Users\%username%\.ollama\models

Para liberar espacio, ollama list y después ollama rm con lo que no uses. Para guardar los modelos en otro disco, define la variable de entorno OLLAMA_MODELS y reinicia Ollama. Nuestra carpeta de modelos ocupa 159 GB (medido el 6-10-2026). Nadie la planeó así; se acumula.

Problemas habituales

  1. El modelo no carga y habla de memoria insuficiente. Elige un modelo más pequeño (de 8B a 3B) o cierra programas que consuman RAM. Un modelo que no cabe no va lento: casi no va.
  2. La GPU no se usa. Ejecuta ollama ps con el modelo cargado y mira la columna PROCESSOR. 100% GPU es lo que quieres. 100% CPU o un reparto como 48%/52% CPU/GPU significa que el modelo no cabe entero en la tarjeta o que falta el driver. Prueba un modelo menor y revisa el driver (nvidia-smi en Linux y Windows).
  3. Va muy lento en un Mac Intel. Es lo esperado: Ollama solo usa la CPU en esos Mac. Quédate en modelos de 3B.
  4. Algo falla y no sabes qué. En Linux, journalctl -e -u ollama muestra el registro del servicio. En macOS está en ~/.ollama/logs.

Cuándo no merece la pena

  • Tienes 4 GB de RAM o menos. Los modelos que caben responden peor que cualquier chat gratuito en la nube.
  • Necesitas la máxima calidad en razonamiento largo. Un modelo de 8B acierta en resúmenes, borradores y clasificación. Se equivoca más en matemáticas, normativa y cadenas largas de pasos. Para eso, un modelo grande en la nube es la opción honesta.
  • Lo usas una vez al mes y tus datos no son sensibles. Lo local gana cuando los datos no pueden salir de tu equipo, cuando el volumen es alto o cuando quieres aprender cómo funciona por dentro.

Próximos pasos

Trabaja con nosotros

Si quieres esto funcionando para tu equipo, con el modelo y la máquina medidos sobre tus tareas reales, lo hacemos contigo. Hablemos 15 minutos o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento