Al terminar este artículo sabrás qué es la IA local, qué piezas necesitas para probarla esta tarde y cómo decidir si te compensa frente a una API en la nube. Puedes empezar con el portátil que ya tienes. Con 8 GB de memoria ya corre un modelo pequeño.
Qué es la IA local
IA local significa que el modelo corre en hardware que controlas tú. Puede ser tu portátil, un mini PC en la oficina o un servidor en tu armario. El prompt y la respuesta no salen de esa máquina.
Una aclaración que ahorra muchas confusiones: casi siempre hablamos de inferencia, no de entrenamiento. Inferencia es usar un modelo que ya está entrenado para que responda. Entrenar un modelo desde cero exige centros de datos y no es un proyecto para una pyme. Ajustar un modelo existente con tus datos (fine-tuning) sí es posible en local, pero es un segundo paso y la mayoría no lo necesita.
Si vienes de la hostelería, piénsalo así. La API en la nube es comer fuera: pagas por plato y la cocina no es tuya. La IA local es tu propia cocina: compras los fogones una vez y decides qué entra por la puerta.
Las tres piezas que necesitas
- Un modelo. Los de pesos abiertos (Llama, Qwen, Gemma, Mistral, DeepSeek) se descargan gratis. Suelen venir en formato GGUF, que define cuánta memoria ocupan. Lo explicamos en cuantización GGUF: elige el archivo correcto.
- Un runtime, el programa que carga el modelo y responde. Ollama es el más sencillo: gratis, sin cuenta y con una API local. llama.cpp es el motor que hay debajo y da más control.
- Memoria suficiente. El archivo del modelo tiene que caber en la RAM o en la VRAM, más un margen para el contexto de la conversación. Si no cabe, no va lento: casi no funciona.
Cuánta memoria hace falta depende del tamaño y de la cuantización. Estas cifras salen del README de quantize de llama.cpp y de la tabla de bartowski, recogidas en nuestra guía GGUF (septiembre de 2026):
| Modelo | Archivo Q4_K_M (4 bits) | Archivo F16 (original) |
|---|---|---|
| Llama 3.1 8B | 4,58 GiB | 14,96 GiB |
| Llama 3.3 70B | 42,5 GB | ~141 GB |
La regla práctica que se deduce: a 4 bits, algo más de medio GB por cada mil millones de parámetros, más el contexto. Antes de descargar nada, calcula tu caso en el explorador de VRAM.
Pruébalo en diez minutos
En Linux, Ollama se instala con una línea. En macOS y Windows, descárgalo desde ollama.com/download. La guía completa, paso a paso y con los problemas habituales: cómo instalar Ollama y ejecutar tu primer LLM en local.
curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3.1:8b "Explica en tres frases qué es la IA local."
ollama ps # muestra cuánta memoria ocupa el modelo cargadoSi tu equipo tiene 8 GB, cambia llama3.1:8b por llama3.2:3b. Si la descarga falla, comprueba que tienes unos 5 GB libres en disco.
Qué medimos en nuestra máquina
Estas cifras salen de nuestra estación de trabajo, no de una ficha de fabricante. Es mucho más máquina de la que necesitas para empezar; está aquí para que tengas una referencia.
| Modelo (Ollama) | Memoria cargado | Generación | Máquina y fecha |
|---|---|---|---|
| llama3.1:8b | 9,2 GB | 41,3 tok/s | DGX Spark GB10, 128 GB, 4-10-2026 |
| qwen2.5-coder:7b | 6,6 GB | 41,0 tok/s | DGX Spark GB10, 128 GB, 4-10-2026 |
| gemma4:26b | 17 GB | 60,7 tok/s | DGX Spark GB10, 128 GB, 4-10-2026 |
| faster-whisper small | n/d | 30 min de audio en unos 7,5 min | DGX Spark GB10, 128 GB, 4-10-2026 |
Fíjate en la tercera fila. El modelo de 26B generó más rápido que los de 7B y 8B. El número de parámetros no predice la velocidad por sí solo; por eso conviene medir. Para medirlo en tu máquina, usa --verbose como explica la guía para instalar Ollama.
En qué es buena hoy y en qué no
Funciona bien en tareas acotadas y repetitivas:
- Resumir, clasificar y extraer datos de documentos.
- Redactar borradores de correos, fichas o informes.
- Responder sobre tus propios documentos con RAG (búsqueda más generación).
- Autocompletar y revisar código con un modelo de 7B.
- Transcribir reuniones con Whisper sin subir el audio a nadie.
Cuándo no hacerlo, o no solo en local: el razonamiento difícil de muchos pasos, los agentes largos y el conocimiento muy especializado. Ahí los mejores modelos de la nube siguen por delante. Además, en local el mantenimiento es tuyo: actualizaciones, copias y seguridad. El patrón que mejor funciona es híbrido: lo rutinario y privado en tu máquina, y una clave de nube con límite de gasto para lo excepcional.
Privacidad y RGPD, en un párrafo
Si el prompt y la respuesta no salen de tu perímetro, no hay un proveedor externo tratando esos datos ni una transferencia internacional que justificar. Eso encaja con la privacidad desde el diseño del artículo 25 del RGPD. No te hace cumplir de forma automática: sigues necesitando base legal, registro de actividades y medidas de seguridad. Lo desarrollamos en RGPD artículo 25: la IA local es privacidad desde el diseño y en RGPD e IA en 2026: el despliegue local como respuesta.
Local frente a API en la nube
| Criterio | IA local | API en la nube |
|---|---|---|
| Dónde están los datos | En tu máquina | En los servidores del proveedor |
| Forma del coste | Hardware una vez, más luz y tu tiempo | Variable, por token consumido |
| Latencia | Sin viaje por la red; depende de tu hardware | Depende de la red y de la carga del proveedor |
| Mantenimiento | Tuyo: actualizar, vigilar, copias | Del proveedor |
| Techo de calidad | El mejor modelo abierto que quepa en tu memoria | Los modelos más capaces del mercado |
| Para empezar | Instalar Ollama y descargar un modelo | Crear cuenta, tarjeta y clave |
Cuándo compensa
La nube cobra por token y la máquina propia es un coste fijo. Por eso la respuesta depende casi siempre del volumen.
- Compensa cuando varias personas lo usan a diario, cuando el volumen es estable y cuando los datos no deben salir del edificio.
- No compensa por coste si haces unas pocas peticiones cortas al día y un modelo pequeño de la nube resuelve la tarea. En ese caso, elige local solo si la privacidad o la previsibilidad pesan más.
- La luz cuenta. Ejemplo: un equipo de 30 W encendido todo el mes consume 30 W × 24 h × 30 días = 21,6 kWh. Multiplícalo por el precio de tu tarifa.
Para poner tus números, usa el script de nube o local: calcula tu punto de equilibrio. Si necesitas un caso de negocio completo, sigue con el marco de ROI de la IA local. La página de hardware incluye una calculadora de amortización.
Veredicto. Compra si tienes volumen diario o datos sensibles. Espera si aún no sabes cuántos tokens usas: mídelo dos semanas. Sáltatelo si lo tuyo son diez preguntas a la semana.
Por dónde empezar, según tu perfil
- Curioso. Instala Ollama en tu portátil con el bloque de arriba y hazle preguntas de tu trabajo. Cuando quieras entender las piezas, el playground tiene ejercicios cortos en el navegador sobre la ventana de contexto, la similitud entre textos y si un modelo cabe en memoria.
- Desarrollador. Empieza por la zona de desarrolladores, elige archivo con la guía GGUF y mide la velocidad con
ollama run <modelo> --verbose. - Empresa. Mira qué compra cada presupuesto en el catálogo de hardware para IA local. Luego calcula el ahorro con el marco de ROI.
Análisis de modelos para seguir
- Qwen 2.5 Coder 7B en tu máquina en 20 minutos: código en un portátil.
- Llama 3.3 70B en tu hardware: qué necesita y cuándo compensa.
- Qwen2.5-72B-Instruct en local frente a un 35B más rápido.
- Google Gemma 4: análisis de la familia de modelos abiertos.
- DeepSeek R1: razonamiento open source ejecutable en local.
Trabaja con nosotros
¿Esto para tu empresa? Hacemos el cálculo con tus volúmenes reales antes de recomendar hardware, y te decimos si la nube te basta. Hablemos 15 minutos o mira cómo trabajamos en consultoría.