Ver todos los artículos
Análisis de ModeloQwenIA LocalEspañolCuantización

Qwen2.5-72B-Instruct en local: el 72B que habla español y el 35B que corre 15 veces más rápido

JG
Jacobo Gonzalez Jaspe
|

Al terminar este artículo sabrás qué necesita Qwen2.5-72B-Instruct para funcionar, qué hace bien en español y por qué un modelo de 35B más nuevo, de tipo mezcla de expertos, respondió al mismo prompt en español quince veces más rápido en la misma máquina. El hardware más barato que mueve el 72B con dignidad es un Mac de 64 GB. La alternativa de 35B funciona en una máquina de 32 GB.

Qué necesitas

  • 64 GB de memoria accesible por la GPU para el 72B a 4 bits (el archivo pesa 47 GB), o 32 GB para el modelo de comparación qwen3.6:35b (23 GB residentes con contexto de 8k en nuestra máquina).
  • Ollama, gratuito, sin cuenta.
  • 50 GB de disco y paciencia para la descarga.
  • Un prompt en español que uses de verdad en el trabajo, para repetir nuestra prueba en tu propio hardware.

Paso 1: conocer el modelo

Qwen2.5-72B-Instruct, del equipo Qwen de Alibaba, tiene 72.700 millones de parámetros (70.000 millones sin contar los embeddings), 80 capas, atención de consulta agrupada con 64 cabezas de consulta y 8 de clave-valor, un contexto de entrada de 131.072 tokens y hasta 8.192 tokens de generación (ficha del modelo). La ficha declara soporte para más de 29 idiomas, con el español nombrado explícitamente junto al portugués, el italiano, el francés y el alemán. Ese entrenamiento multilingüe es el motivo por el que ha sido un favorito para trabajar en español desde finales de 2024.

Dos detalles antes de desplegarlo. La licencia que figura en la ficha es “qwen”, una licencia propia y no Apache 2.0, así que léela una vez. Y los contextos por encima de 32k tokens requieren activar el escalado YaRN (factor 4) en el motor de inferencia; Ollama lo gestiona por ti, pero otros servidores no.

Paso 2: elegir la cuantización

Tamaños tomados del repositorio GGUF de bartowski y de la página de etiquetas de Ollama. El 72B es un 10 por ciento mayor que Llama 3.3 70B en cada nivel (47 GB frente a 43 GB en Q4_K_M), así que pide el mismo hardware con algo menos de margen.

CuantizaciónTamaño del archivoEtiqueta en OllamaCabe con holgura en
Q8_077 GBqwen2.5:72b-instruct-q8_0128 GB de memoria unificada
Q6_K64 GBqwen2.5:72b-instruct-q6_KMac de 96 GB
Q5_K_M54 GBqwen2.5:72b-instruct-q5_K_MMac de 64 GB (justo, contexto corto)
Q4_K_M (por defecto)47 GBqwen2.5:72bMac de 64 GB, 2 GPU de 24 GB con descarga a CPU
IQ4_XS40 GB(solo GGUF)2 GPU de 24 GB completamente en GPU
Q3_K_M38 GBqwen2.5:72b-instruct-q3_K_M48 GB, pérdida de calidad visible
IQ2_M29 GB(solo GGUF)una máquina de 32 GB, claramente peor

Paso 3: ejecutar la misma prueba en español que hicimos nosotros

ollama pull qwen2.5:72b        # 47 GB
ollama pull qwen3.6:35b        # 23 GB, el modelo de comparación
cat > prompt_es.json <<'EOF'
{"model":"qwen2.5:72b","stream":false,"think":false,
 "prompt":"Redacta en español, en unas 300 palabras y sin listas, un correo profesional a un cliente de una asesoría de Valencia explicándole qué documentación debe preparar para el cierre contable del tercer trimestre y por qué conviene entregarla antes del día 15.",
 "options":{"num_predict":450,"temperature":0.3,"num_ctx":8192}}
EOF
curl -s localhost:11434/api/generate -d @prompt_es.json \
  | python3 -c "import json,sys; d=json.load(sys.stdin); print(round(d['eval_count']/d['eval_duration']*1e9,1),'tok/s'); print(d['response'][:400])"
ollama ps                      # memoria residente de lo que acaba de ejecutarse

Cambia "model" a qwen3.6:35b y repite. El parámetro think:false importa con qwen3.6: sin él, el modelo gasta todo el presupuesto de tokens razonando en silencio y devuelve un response vacío, que es exactamente lo que nos pasó en el primer intento.

Qué medimos

Todas las ejecuciones son del 09-09-2026, en nuestra estación NVIDIA GB10 (128 GB de memoria unificada, Ollama 0.30.10), una máquina compartida con otros servicios; toma los números como un suelo, no como un resultado de laboratorio. Para el 72B usamos qwen2.5vl:72b, la versión visión-lenguaje cuyo modelo de lenguaje es la base Qwen2.5-72B (Q4_K_M, 73.400 millones de parámetros contando la torre de visión, según ollama show). Es un sustituto del modelo Instruct de solo texto, no el mismo archivo, y lo decimos tal cual.

ModeloArquitecturaVelocidad con el prompt en españolMemoria residente (ollama ps)Procesado del prompt
qwen2.5vl:72b, Q4_K_Mdensa, 73.400 M3,2 tok/s en frío, 2,7 tok/s en la segunda pasada (450 tokens)49 GB con contexto de 8k136 a 141 tok/s
qwen3.6:35b, Q4_K_Mmezcla de expertos, 36.000 M en total60,4 / 36,6 / 39,1 tok/s en tres pasadas23 GB con contexto de 8k (29 GB con su valor por defecto de 262k)155 a 166 tok/s
llama3.1:8b, Q4_K_Mdensa, 8.000 M29,3 tok/s5,3 GB con contexto de 4k759 tok/s

Como referencia, Ollama midió llama3.1:70b Q4_K_M a 4,4 tok/s en una DGX Spark, que usa el mismo chip GB10 que nuestra estación (blog de Ollama, octubre de 2025). Nuestros 3 tok/s con un modelo algo mayor, en una máquina ocupada, encajan con ese dato. En hardware con memoria más rápida la clase 70B va mejor: 17,2 tok/s con Llama 3.3 70B Q4_K_M en un M4 Max de 64 GB (Markaicode) y 21,0 tok/s con Llama 3 70B en dos RTX 4090 (Sergey Nog). No encontramos ninguna medición publicada de Qwen2.5-72B en esas dos configuraciones; escalando por tamaño de archivo (47 frente a 43 GB) saldría un 10 por ciento más lento, así que espera unos 15 tok/s en el Mac y unos 19 tok/s en el par de GPU. Es nuestra estimación, no una medición.

Por qué 36.000 millones de parámetros corrieron 15 veces más rápido que 72.000

Un modelo denso usa todos sus parámetros en cada token: los 49 GB completos pasan por la memoria cada vez. Un modelo de mezcla de expertos (MoE) como qwen3.6:35b mantiene los 36.000 millones de parámetros en memoria, pero solo activa unos pocos bloques “expertos” por token, así que lee una fracción de los pesos y genera a velocidad de modelo de 8B con mucho más conocimiento que un 8B. Ese intercambio es lo que hace que el 72B denso de 2024 sea más difícil de justificar en 2026.

La calidad del español fue buena en ambos. El 72B abrió con un registro formal correcto: “Espero que este correo le encuentre bien. Como asesoría especializada en Valencia, nos complace recordarle la importancia de prepararse para el cierre contable del tercer trimestre.” El 35B produjo una carta igual de natural, algo más larga y en el mismo registro, y terminó en 12 segundos en lugar de 166. El 8B también fue fluido pero genérico, con las mismas frases de plantilla que un lector español ha visto mil veces.

Dónde sigue mereciendo su sitio el 72B

  1. Documentos largos en español y portugués donde importa el matiz. Contratos, pliegos, texto normativo: el 72B denso pierde menos detalles que el 8B y quedó a la par del 35B en nuestra pequeña prueba, así que es una elección razonable si ya lo tienes desplegado y validado.
  2. Salida estructurada a gran escala. Los puntos fuertes de Qwen2.5 según su ficha son la generación de textos largos, la comprensión de tablas y la salida en JSON; a un lote nocturno que convierte 2.000 PDF en filas le dan igual los 3 tok/s.
  3. Pipelines ya validados. Si tus prompts se ajustaron sobre Qwen2.5-72B en 2025 y las salidas pasan la revisión, cambiar de modelo también tiene un coste. Mide antes de cambiar.

Para todo lo interactivo, ejecuta qwen3.6:35b o un modelo de 8B y reserva el 72B para el trabajo en cola.

Límites honestos

  • 3 tok/s en estaciones con memoria unificada. Una respuesta de 450 tokens tarda dos minutos y medio en nuestra máquina. Solo un Mac de 64 GB o un par de GPU lo hacen conversacional.
  • Memoria. 47 GB de pesos más el contexto: ninguna máquina de 32 GB, ningún portátil.
  • La licencia no es Apache 2.0. El modelo qwen3.6 sí lo es; el 2.5-72B no. Compruébalo antes de redistribuir.
  • Su conocimiento se detiene en 2024. El modelo se publicó en septiembre de 2024 y la ficha no indica fecha de corte, así que combínalo con recuperación sobre tus propios documentos para cualquier cosa actual.

Siguientes pasos

Trabaja con nosotros

Hacemos exactamente esta prueba con prompts en español sobre los documentos del propio cliente antes de recomendar un modelo, y publicamos lo que medimos. Si quieres que la hagamos con tu carga de trabajo, escríbenos o mira cómo trabajamos en consultoría.

Compartir: LinkedIn X
Newsletter

Acceda a recursos exclusivos

Suscríbase para desbloquear 230+ workflows, 43 agentes y 26 plantillas profesionales. Insights semanales sin spam.

Bonus: Checklist EU AI Act gratis al suscribirte
1x por semana Sin spam Cancela cuando quieras
EU AI Act en vigor — ¿Está su organización en cumplimiento?

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él — antes de que gastes nada.

Autoservicio Local-first Toolkits open-source

136 páginas de recursos gratuitos · 26 plantillas de compliance · 22 dispositivos certificados