Llama 3.3 70B en tu propio hardware: qué hace falta para ejecutarlo y cuándo compensa
Al terminar este artículo sabrás si Llama 3.3 70B cabe en la máquina que tienes, qué velocidad esperar y cuáles son las tres tareas de negocio que justifican usarlo en lugar de un modelo de 8B que corre diez veces más rápido. El punto de entrada más barato que funciona es un Mac de 64 GB; un portátil de 16 GB no sirve, y lo decimos desde el principio.
Qué necesitas
- Una máquina con al menos 48 GB de memoria a la que llegue la GPU: un Mac con Apple Silicon de 64 GB, un PC con dos tarjetas gráficas de 24 GB o una estación con memoria unificada. Solo el archivo de 4 bits ocupa 43 GB.
- Ollama instalado. Sin cuenta, sin clave de API.
- Unos 45 GB de disco libre y tiempo para descargar: la etiqueta por defecto pesa 43 GB.
- Veinte minutos para los pasos de abajo una vez termine la descarga.
Paso 1: saber qué estás descargando
Meta publicó Llama 3.3 70B Instruct el 6 de diciembre de 2024 bajo la Llama 3.3 Community License. Es un modelo de texto denso de 70.000 millones de parámetros, con contexto de 128k tokens, entrenado con más de 15 billones de tokens y con soporte oficial para ocho idiomas, español incluido (ficha del modelo). Su fecha de corte de conocimiento es diciembre de 2023: no sabe nada posterior salvo que se lo pongas en el prompt.
Por qué sigue interesando en 2026: en la propia tabla de Meta iguala o supera al modelo de 405B en seguimiento de instrucciones (IFEval 92,1 frente a 88,6) y en matemáticas (MATH 77,0 frente a 73,8), y deja muy atrás a Llama 3.1 8B en todas las pruebas difíciles (MMLU Pro 68,9 frente a 48,3; GPQA Diamond 50,5 frente a 31,8). Son números de Meta, no nuestros.
Paso 2: elegir una cuantización que quepa en tu memoria
La cuantización guarda cada peso con menos bits para que el archivo encoja. Los tamaños salen de los GGUF de bartowski y de las etiquetas de la biblioteca de Ollama. Suma entre 2 y 6 GB más para la caché de contexto y el motor.
| Cuantización | Tamaño del archivo | Etiqueta en Ollama | Cabe con holgura en |
|---|---|---|---|
| Q8_0 | 75 GB | llama3.3:70b-instruct-q8_0 | 128 GB de memoria unificada |
| Q6_K | 58 GB | llama3.3:70b-instruct-q6_K | Mac de 96 GB, estación de 128 GB |
| Q5_K_M | 50 GB | llama3.3:70b-instruct-q5_K_M | Mac de 64 GB (justo) |
| Q4_K_M (por defecto) | 43 GB | llama3.3:70b | Mac de 64 GB, 2 GPU de 24 GB |
| IQ4_XS | 38 GB | (solo GGUF) | 2 GPU de 24 GB con más margen de contexto |
| Q3_K_M | 34 GB | llama3.3:70b-instruct-q3_K_M | Mac de 48 GB, pérdida de calidad visible |
| IQ2_M | 24 GB | (solo GGUF) | una GPU de 24 GB, respuestas claramente peores |
Nuestra regla: quédate en Q4_K_M o superior para todo lo que vaya a leer un cliente. Por debajo de Q4 el modelo sigue hablando con fluidez, pero empieza a perder detalles en documentos largos, que es justo el trabajo para el que compraste un 70B.
Paso 3: ejecutarlo
ollama pull llama3.3:70b # 43 GB, Q4_K_M
ollama run llama3.3:70b "Resume las tres obligaciones principales de este contrato: ..."
ollama ps # muestra la memoria residente y si está al 100% en GPU
Si ollama ps muestra un porcentaje de CPU en lugar de 100% GPU, el modelo no ha cabido en la memoria gráfica y obtendrás uno o dos tokens por segundo. Baja a una cuantización menor o reduce el contexto con OLLAMA_CONTEXT_LENGTH=8192.
Para cronometrar tú mismo una ejecución, pide los contadores a la API:
curl -s localhost:11434/api/generate -d '{"model":"llama3.3:70b","prompt":"Explica el IVA de caja para una pyme española en 200 palabras.","stream":false}' \
| python3 -c "import json,sys; d=json.load(sys.stdin); print(round(d['eval_count']/d['eval_duration']*1e9,1),'tok/s')"
Qué medimos y qué citamos
No descargamos los 43 GB de Llama 3.3 para este artículo. En su lugar ejecutamos el modelo de clase 72B que ya teníamos en la máquina, qwen2.5vl:72b (Q4_K_M, 49 GB residentes), que enseña lo que hace un modelo denso de 70B en nuestro hardware. El resto de filas son mediciones de terceros con su enlace.
| Hardware | Modelo | Velocidad | Fuente y fecha |
|---|---|---|---|
| Nuestra estación NVIDIA GB10, 128 GB de memoria unificada, Ollama 0.30.10 | qwen2.5vl:72b Q4_K_M, respuesta de 450 tokens en español, contexto 8k | 3,2 tok/s en frío, 2,7 tok/s en la segunda pasada; 49 GB residentes | medido el 09-09-2026, máquina compartida con otros servicios |
| La misma estación | llama3.1:8b Q4_K_M, el mismo prompt en español | 29,3 tok/s | medido el 09-09-2026 |
| NVIDIA DGX Spark (el mismo chip GB10) | llama3.1:70b Q4_K_M | 4,4 tok/s de generación, 1.911 tok/s de prefill | Blog de Ollama, 23-10-2025 |
| MacBook Pro M4 Max, 64 GB | Llama 3.3 70B Q4_K_M, Ollama | 17,2 tok/s | Markaicode |
| MacBook Pro M4 Max, 64 GB | Llama 3.1 70B Q4_K_M, llama.cpp | 12,5 tok/s | Markaicode |
| 2 RTX 4090, 48 GB en total | Llama 3 70B, 4 bits | 21,0 tok/s | Sergey Nog |
| 1 RTX 3090, 24 GB, el resto en CPU | Llama 3 70B Q4_K_M | 5,2 tok/s | GigaGPU |
Léelo con honestidad. Un modelo de 70B está limitado por el ancho de banda de memoria: los 43 GB enteros tienen que pasar por el procesador en cada token. Por eso dos 4090 o un M4 Max ganan a nuestra estación de 128 GB por un factor de cinco en generación, mientras que la estación gana donde importa la capacidad (cuantizaciones mayores, contexto largo, varios modelos cargados a la vez). También explica por qué nuestro modelo de 8B respondió al mismo prompt en español a 29 tok/s: nueve veces menos datos por token.
Qué tareas de pyme justifican un 70B frente a un 8B
Un modelo de 8B resuelve clasificación, resúmenes cortos, borradores de correos y extracción estructurada de documentos limpios. Recurre al 70B cuando la tarea se parezca a una de estas:
- Contratos y pliegos largos en español. Leer 40 páginas y responder “qué cláusulas nos trasladan la responsabilidad” exige profundidad de razonamiento y el contexto de 128k. El 8B parafrasea; el 70B cita la cláusula.
- Análisis en varios pasos. “Compara estas tres ofertas de proveedor con nuestra política de compras y marca las excepciones” encadena varios juicios. La diferencia en MMLU Pro (68,9 frente a 48,3) se traduce aquí en menos errores silenciosos.
- Revisión de código con lógica de negocio. HumanEval 88,4 frente a 72,6 es la diferencia entre detectar un error de índice en un script de facturación y felicitarlo.
Si tu volumen diario es alto y las tareas son sencillas, ejecuta el 8B a 30 tok/s y reserva el 70B para un lote nocturno. Entre 3 y 20 tok/s, una respuesta de 500 tokens tarda entre 25 segundos y tres minutos: perfecto para una cola, frustrante en una ventana de chat.
Límites honestos
- La memoria es el muro. Ninguna máquina de 16 o 32 GB ejecuta este modelo de forma útil. No intentes que lo haga un portátil.
- Electricidad. Una torre con dos GPU consume varias veces lo que un Mac de 64 GB a plena carga; comprueba el TDP en la ficha técnica de las tarjetas que estés valorando. Inclúyelo en el cálculo de amortización.
- Conocimiento de diciembre de 2023. Combínalo con recuperación sobre tus propios documentos; no le preguntes por normativa de 2026.
- Licencia. La Llama 3.3 Community License permite el uso comercial con condiciones; léela una vez antes de desplegarlo para clientes.
Siguientes pasos
- Entiende qué te cuestan en calidad las etiquetas Q4 y Q5: La cuantización explicada.
- ¿Necesitas razonamiento más que tamaño? Compara con DeepSeek-R1 para razonamiento local.
- Calcula si el hardware se amortiza: Nube o local: tu punto de equilibrio en 15 minutos.
Trabaja con nosotros
Dimensionamos los despliegues de 70B con los documentos y los recuentos de tokens reales del cliente antes de recomendar un Mac, un par de GPU o una estación compartida. Si quieres una segunda opinión sobre el tuyo, escríbenos o mira cómo trabajamos en consultoría.