Ver todos los artículos
LLMOllamaIA localHardwareComparativa

Mejores LLM locales: cuál usar según tu hardware y tu tarea

JG
Jacobo González Jaspe
|
Ilustración abstracta: cintas de luz ámbar y blanca que se entrelazan en una curva suave. Modelos
Ilustración generada con IA en nuestra máquina.
Este artículo también está en inglés:Best local LLMs: which one to use for your hardware and task

Al terminar sabrás qué modelo descargar para tu tarea y tu memoria, y cómo comprobarlo con tus propios números en diez minutos. Empieza en cualquier portátil con 8 GB de RAM. La regla de fondo es simple: el modelo más pequeño que hace bien el trabajo.

Última revisión: 6 de octubre de 2026. Tamaños tomados de la biblioteca de Ollama ese día; velocidades medidas en nuestra NVIDIA DGX Spark. Revisamos esta tabla cuando cambia un modelo de la lista.

Qué necesitas

  • Un ordenador con 8 GB de memoria o más. Una GPU ayuda, pero no es obligatoria.
  • Ollama instalado. Es gratis y no pide cuenta.
  • Diez prompts reales de tu trabajo, guardados en un archivo de texto.
  • Entre 2 y 20 GB de disco libre, según la columna que elijas.

Paso 1: averigua cuánta memoria puede usar el modelo

El número que cuenta es la memoria a la que llega el modelo. En un Mac o en un portátil sin GPU es la RAM total, porque se comparte. En un PC con tarjeta gráfica es la VRAM de la tarjeta.

bash
# Linux con GPU NVIDIA: VRAM total
nvidia-smi --query-gpu=memory.total --format=csv
# macOS: memoria unificada en bytes
sysctl hw.memsize

Con memoria compartida, el sistema operativo se queda una parte. Nuestro explorador de VRAM reserva 3 GB en equipos de hasta 16 GB, 4 GB hasta 32 GB y 6 GB por encima. Un portátil de 8 GB deja unos 5 GB para el modelo.

Paso 2: elige en la tabla

Cada celda da la etiqueta para ollama pull y el tamaño de descarga que muestra su página en la biblioteca de Ollama. Donde aparece un rango, Ollama sirve archivos distintos según la plataforma.

Tarea8 GB16 GB24-32 GB64 GB o más
Chat y asistenteqwen3:4b (2,5 GB)qwen3:8b (5,2 GB)gemma4:26b (16-19 GB)qwen3.6:35b (23-24 GB)
Códigoqwen2.5-coder:3b (1,9 GB)qwen2.5-coder:7b (4,7 GB)qwen3-coder:30b (19 GB)qwen3.6:35b-coding (23-24 GB)
Documentos y RAGbge-m3 (1,2 GB) + qwen3:4bbge-m3 + qwen3:8bbge-m3 + gemma4:26bbge-m3 + qwen3.6:35b
Razonamientoqwen3:4b-thinking (2,5 GB)deepseek-r1:14b (9,0 GB)qwen3:30b-thinking (19 GB)qwen3:30b-thinking con contexto largo
Visión (fotos, PDF escaneados)qwen3-vl:2b (1,9 GB)qwen3-vl:8b (6,1 GB)qwen3-vl:30b (20 GB)qwen3-vl:30b; qwen2.5vl:72b (49 GB) solo por lotes
Redacción en españolqwen3:4bgemma4:e4b (6,6-9,5 GB)gemma4:26bqwen3.6:35b
Voz a texto (fuera de Ollama)faster-whisper smallsmallmediumlarge-v3

Cómo calculamos que cabe: tamaño de la biblioteca, más la caché de contexto, más 1,5 GB de runtime. Es la misma cuenta que usa src/lib/hardware-math.ts en este sitio. La caché de un modelo de 3 a 8B con 4.096 tokens ronda 0,5 GB.

Hay celdas que van justas. qwen3:4b necesita unos 4,5 GB en un portátil de 8 GB, así que cierra el navegador. La columna de 24-32 GB pide entre 17 y 22 GB: con una GPU de 24 GB o con 32 GB compartidos va cómoda, y con un Mac de 24 GB va al límite.

La voz a texto no pasa por Ollama. Usa faster-whisper: su README mide small en CPU con 1,5 GB de RAM en int8, y large-v2 en GPU con 2,9 GB en int8. large-v3 tiene el mismo número de parámetros que large-v2.

Por qué la columna de 64 GB repite modelos

Más memoria no significa un modelo más grande. Los modelos que tienen a3b o a4b en su etiqueta son de mezcla de expertos: guardan todos los parámetros pero activan unos 3 o 4 mil millones por token. Por eso qwen3.6:35b generó más rápido que deepseek-r1:14b en nuestra prueba.

Con 64 GB o más, lo que ganas es contexto largo y espacio para tener dos modelos cargados a la vez, por ejemplo un modelo de chat y otro de visión. Un modelo denso de 70B cabe, pero en nuestra máquina qwen2.5vl:72b dio unos 3 tokens por segundo. Sirve para lotes nocturnos, no para conversar.

Paso 3: descarga y mide en tu máquina

Descarga la etiqueta de tu celda y mide la velocidad con la misma llamada que usamos nosotros:

bash
ollama pull qwen3:8b
curl -s localhost:11434/api/generate -d '{
  "model": "qwen3:8b", "stream": false, "think": false,
  "prompt": "Escribe un correo breve para mover una reunión del jueves al lunes.",
  "options": {"num_predict": 200, "num_ctx": 4096}
}' | python3 -c "import json,sys; d=json.load(sys.stdin); print(round(d['eval_count']/d['eval_duration']*1e9,1),'tok/s')"
ollama ps   # la columna SIZE es la memoria que ocupa de verdad

Salida esperada: una línea con tokens por segundo y una tabla de ollama ps. Si PROCESSOR no dice 100% GPU en una máquina con GPU, el modelo no cabía entero. Baja a la celda de la izquierda o reduce num_ctx.

Por debajo de unos 10 tokens por segundo, leer la respuesta se hace lento. Para medir tu propia máquina con --verbose, sigue la guía para instalar Ollama.

Paso 4: prueba la calidad con tus diez prompts

La velocidad se mide en un segundo. La calidad solo la juzgas tú. Pasa tus diez prompts por la celda de tu memoria y por la de la izquierda, con temperature: 0, y compara las respuestas una al lado de la otra.

Si no distingues las respuestas, quédate con el modelo pequeño. Liberas memoria y ganas velocidad. Para redacción en español, mira acentos, concordancias y si el modelo cuela palabras en inglés.

Qué medimos

NVIDIA DGX Spark (GB10, 128 GB de memoria unificada), Ollama 0.30.10, contexto de 4.096 tokens. Es una máquina compartida con otros servicios, así que toma las cifras como un suelo.

ModeloVelocidad de generaciónMemoria cargadaFecha
qwen2.5-coder:7b41,0 tok/s6,6 GB4-10-2026
gemma4:26b60,7 tok/s17 GB4-10-2026
deepseek-r1:14b (sin modo de pensamiento)21,6 tok/s, una ejecución9,5 GB6-10-2026
qwen2.5vl:7b (prompt de texto)42,3 tok/s, una ejecuciónno medida6-10-2026
qwen3.6:35b71,0 tok/s, una ejecución23 GB6-10-2026
qwen2.5vl:72b2,7 a 3,2 tok/s49 GB con 8k de contexto9-9-2026
faster-whisper small0,252 x tiempo realno medida4-10-2026
faster-whisper medium0,513 x tiempo realno medida4-10-2026

Un factor de 0,252 significa que una reunión de 30 minutos se transcribe en unos 7,5. Una Spark no es tu portátil. En un equipo de 16 GB sin GPU dedicada espera cifras bastante más bajas, y por eso existe el Paso 3.

Cuándo es mejor una API en la nube

  • Agentes de código sobre un repositorio grande. Un modelo de 7 a 30B completa funciones y explica código. Planificar cambios en cincuenta archivos sigue siendo terreno de los modelos grandes en la nube.
  • Uso esporádico con datos no sensibles. Si haces veinte consultas al mes, pagar por uso sale más barato que cualquier equipo. Haz la cuenta con nube o local: tu punto de equilibrio.
  • Razonamiento largo donde un error cuesta caro. Un modelo local de 14B razona bien en problemas acotados. Para análisis legal o financiero delicado, compara con un modelo grande antes de fiarte.

Lo local gana cuando los datos no deben salir de tu red, cuando el volumen es alto y constante, o cuando quieres un coste fijo. La electricidad y tu tiempo también cuentan como coste.

Siguientes pasos

Trabaja con nosotros

Si quieres ver tu tarea funcionando en hardware real antes de comprar nada, medimos el modelo y la máquina con tus prompts. Hablemos 15 minutos o mira cómo trabajamos en consultoría.

Diagrama
Compartir: LinkedIn X
Veredicto semanal

Recibe las guías nuevas antes que nadie

Suscríbete y te avisamos cuando publiquemos guías, plantillas y workflows nuevos. Un correo a la semana, sin spam.

Ya publicados: 66 guías y 25 plantillas. Todo gratis y sin registro.

Bonus: el kit de inicio de IA local en PDF al suscribirte
1x por semana Sin spam Cancela cuando quieras

Ver qué recibes

La Ley de IA de la UE ya aplica: una lista que puedes completar

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él, antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

66 guías gratuitas · 17 plantillas de cumplimiento