Qwen2.5-72B-Instruct en local: el 72B que habla español y el 35B que corre 15 veces más rápido
Al terminar este artículo sabrás qué necesita Qwen2.5-72B-Instruct para funcionar, qué hace bien en español y por qué un modelo de 35B más nuevo, de tipo mezcla de expertos, respondió al mismo prompt en español quince veces más rápido en la misma máquina. El hardware más barato que mueve el 72B con dignidad es un Mac de 64 GB. La alternativa de 35B funciona en una máquina de 32 GB.
Qué necesitas
- 64 GB de memoria accesible por la GPU para el 72B a 4 bits (el archivo pesa 47 GB), o 32 GB para el modelo de comparación
qwen3.6:35b(23 GB residentes con contexto de 8k en nuestra máquina). - Ollama, gratuito, sin cuenta.
- 50 GB de disco y paciencia para la descarga.
- Un prompt en español que uses de verdad en el trabajo, para repetir nuestra prueba en tu propio hardware.
Paso 1: conocer el modelo
Qwen2.5-72B-Instruct, del equipo Qwen de Alibaba, tiene 72.700 millones de parámetros (70.000 millones sin contar los embeddings), 80 capas, atención de consulta agrupada con 64 cabezas de consulta y 8 de clave-valor, un contexto de entrada de 131.072 tokens y hasta 8.192 tokens de generación (ficha del modelo). La ficha declara soporte para más de 29 idiomas, con el español nombrado explícitamente junto al portugués, el italiano, el francés y el alemán. Ese entrenamiento multilingüe es el motivo por el que ha sido un favorito para trabajar en español desde finales de 2024.
Dos detalles antes de desplegarlo. La licencia que figura en la ficha es “qwen”, una licencia propia y no Apache 2.0, así que léela una vez. Y los contextos por encima de 32k tokens requieren activar el escalado YaRN (factor 4) en el motor de inferencia; Ollama lo gestiona por ti, pero otros servidores no.
Paso 2: elegir la cuantización
Tamaños tomados del repositorio GGUF de bartowski y de la página de etiquetas de Ollama. El 72B es un 10 por ciento mayor que Llama 3.3 70B en cada nivel (47 GB frente a 43 GB en Q4_K_M), así que pide el mismo hardware con algo menos de margen.
| Cuantización | Tamaño del archivo | Etiqueta en Ollama | Cabe con holgura en |
|---|---|---|---|
| Q8_0 | 77 GB | qwen2.5:72b-instruct-q8_0 | 128 GB de memoria unificada |
| Q6_K | 64 GB | qwen2.5:72b-instruct-q6_K | Mac de 96 GB |
| Q5_K_M | 54 GB | qwen2.5:72b-instruct-q5_K_M | Mac de 64 GB (justo, contexto corto) |
| Q4_K_M (por defecto) | 47 GB | qwen2.5:72b | Mac de 64 GB, 2 GPU de 24 GB con descarga a CPU |
| IQ4_XS | 40 GB | (solo GGUF) | 2 GPU de 24 GB completamente en GPU |
| Q3_K_M | 38 GB | qwen2.5:72b-instruct-q3_K_M | 48 GB, pérdida de calidad visible |
| IQ2_M | 29 GB | (solo GGUF) | una máquina de 32 GB, claramente peor |
Paso 3: ejecutar la misma prueba en español que hicimos nosotros
ollama pull qwen2.5:72b # 47 GB
ollama pull qwen3.6:35b # 23 GB, el modelo de comparación
cat > prompt_es.json <<'EOF'
{"model":"qwen2.5:72b","stream":false,"think":false,
"prompt":"Redacta en español, en unas 300 palabras y sin listas, un correo profesional a un cliente de una asesoría de Valencia explicándole qué documentación debe preparar para el cierre contable del tercer trimestre y por qué conviene entregarla antes del día 15.",
"options":{"num_predict":450,"temperature":0.3,"num_ctx":8192}}
EOF
curl -s localhost:11434/api/generate -d @prompt_es.json \
| python3 -c "import json,sys; d=json.load(sys.stdin); print(round(d['eval_count']/d['eval_duration']*1e9,1),'tok/s'); print(d['response'][:400])"
ollama ps # memoria residente de lo que acaba de ejecutarse
Cambia "model" a qwen3.6:35b y repite. El parámetro think:false importa con qwen3.6: sin él, el modelo gasta todo el presupuesto de tokens razonando en silencio y devuelve un response vacío, que es exactamente lo que nos pasó en el primer intento.
Qué medimos
Todas las ejecuciones son del 09-09-2026, en nuestra estación NVIDIA GB10 (128 GB de memoria unificada, Ollama 0.30.10), una máquina compartida con otros servicios; toma los números como un suelo, no como un resultado de laboratorio. Para el 72B usamos qwen2.5vl:72b, la versión visión-lenguaje cuyo modelo de lenguaje es la base Qwen2.5-72B (Q4_K_M, 73.400 millones de parámetros contando la torre de visión, según ollama show). Es un sustituto del modelo Instruct de solo texto, no el mismo archivo, y lo decimos tal cual.
| Modelo | Arquitectura | Velocidad con el prompt en español | Memoria residente (ollama ps) | Procesado del prompt |
|---|---|---|---|---|
| qwen2.5vl:72b, Q4_K_M | densa, 73.400 M | 3,2 tok/s en frío, 2,7 tok/s en la segunda pasada (450 tokens) | 49 GB con contexto de 8k | 136 a 141 tok/s |
| qwen3.6:35b, Q4_K_M | mezcla de expertos, 36.000 M en total | 60,4 / 36,6 / 39,1 tok/s en tres pasadas | 23 GB con contexto de 8k (29 GB con su valor por defecto de 262k) | 155 a 166 tok/s |
| llama3.1:8b, Q4_K_M | densa, 8.000 M | 29,3 tok/s | 5,3 GB con contexto de 4k | 759 tok/s |
Como referencia, Ollama midió llama3.1:70b Q4_K_M a 4,4 tok/s en una DGX Spark, que usa el mismo chip GB10 que nuestra estación (blog de Ollama, octubre de 2025). Nuestros 3 tok/s con un modelo algo mayor, en una máquina ocupada, encajan con ese dato. En hardware con memoria más rápida la clase 70B va mejor: 17,2 tok/s con Llama 3.3 70B Q4_K_M en un M4 Max de 64 GB (Markaicode) y 21,0 tok/s con Llama 3 70B en dos RTX 4090 (Sergey Nog). No encontramos ninguna medición publicada de Qwen2.5-72B en esas dos configuraciones; escalando por tamaño de archivo (47 frente a 43 GB) saldría un 10 por ciento más lento, así que espera unos 15 tok/s en el Mac y unos 19 tok/s en el par de GPU. Es nuestra estimación, no una medición.
Por qué 36.000 millones de parámetros corrieron 15 veces más rápido que 72.000
Un modelo denso usa todos sus parámetros en cada token: los 49 GB completos pasan por la memoria cada vez. Un modelo de mezcla de expertos (MoE) como qwen3.6:35b mantiene los 36.000 millones de parámetros en memoria, pero solo activa unos pocos bloques “expertos” por token, así que lee una fracción de los pesos y genera a velocidad de modelo de 8B con mucho más conocimiento que un 8B. Ese intercambio es lo que hace que el 72B denso de 2024 sea más difícil de justificar en 2026.
La calidad del español fue buena en ambos. El 72B abrió con un registro formal correcto: “Espero que este correo le encuentre bien. Como asesoría especializada en Valencia, nos complace recordarle la importancia de prepararse para el cierre contable del tercer trimestre.” El 35B produjo una carta igual de natural, algo más larga y en el mismo registro, y terminó en 12 segundos en lugar de 166. El 8B también fue fluido pero genérico, con las mismas frases de plantilla que un lector español ha visto mil veces.
Dónde sigue mereciendo su sitio el 72B
- Documentos largos en español y portugués donde importa el matiz. Contratos, pliegos, texto normativo: el 72B denso pierde menos detalles que el 8B y quedó a la par del 35B en nuestra pequeña prueba, así que es una elección razonable si ya lo tienes desplegado y validado.
- Salida estructurada a gran escala. Los puntos fuertes de Qwen2.5 según su ficha son la generación de textos largos, la comprensión de tablas y la salida en JSON; a un lote nocturno que convierte 2.000 PDF en filas le dan igual los 3 tok/s.
- Pipelines ya validados. Si tus prompts se ajustaron sobre Qwen2.5-72B en 2025 y las salidas pasan la revisión, cambiar de modelo también tiene un coste. Mide antes de cambiar.
Para todo lo interactivo, ejecuta qwen3.6:35b o un modelo de 8B y reserva el 72B para el trabajo en cola.
Límites honestos
- 3 tok/s en estaciones con memoria unificada. Una respuesta de 450 tokens tarda dos minutos y medio en nuestra máquina. Solo un Mac de 64 GB o un par de GPU lo hacen conversacional.
- Memoria. 47 GB de pesos más el contexto: ninguna máquina de 32 GB, ningún portátil.
- La licencia no es Apache 2.0. El modelo qwen3.6 sí lo es; el 2.5-72B no. Compruébalo antes de redistribuir.
- Su conocimiento se detiene en 2024. El modelo se publicó en septiembre de 2024 y la ficha no indica fecha de corte, así que combínalo con recuperación sobre tus propios documentos para cualquier cosa actual.
Siguientes pasos
- Qué cuestan en calidad Q4 y Q5, con números: La cuantización explicada.
- Si necesitas razonamiento paso a paso más que idiomas: Análisis de DeepSeek-R1 en local.
- Si una máquina de 64 GB se amortiza: Nube o local: punto de equilibrio.
Trabaja con nosotros
Hacemos exactamente esta prueba con prompts en español sobre los documentos del propio cliente antes de recomendar un modelo, y publicamos lo que medimos. Si quieres que la hagamos con tu carga de trabajo, escríbenos o mira cómo trabajamos en consultoría.