NVIDIA (custom build) · PC con GPU
RTX 4060 Ti 16GB Build
La inferencia de 14B más rápida, ecosistema CUDA
- 16 GBmemoria de GPU (VRAM)
- 14Bcabe en memoria (Q4, 8k)
- 14Bpráctico (estimación)
- 300 Wconsumo máximo
- ~1.000 €precio orientativo
¿Qué puede ejecutar?
Elige una tarea o un tamaño de modelo. La barra compara lo que necesita con la memoria útil de esta máquina.
- Pesos del modelo
- Caché de contexto
- Motor + extras (Whisper, embeddings)
Cómo lo calculamos
Pesos = parámetros × bits por peso / 8 (Q4_K_M ≈ 4,85; Q8_0 ≈ 8,5). Caché = tokens de contexto × tamaño por token del modelo de referencia (capas × cabezas KV × dimensión × 2 × 2 bytes). Más 1,5 GB de motor. Memoria útil = total menos lo que se queda el sistema (3–6 GB en memoria compartida, 0,5 GB en una GPU). Holgado = cabe en el 85 %. Es una estimación de ±20 %: mídelo en tu máquina antes de decidir. Cómo elegir el archivo GGUF
¿Cuándo sale más barato que la nube?
Ajusta tu uso. Comparamos la compra más la luz con lo que pagarías a una API en la nube.
| Mes | Equipo propio | Nube |
|---|
- Equipo propio (compra + luz)
- API en la nube
Supuestos: 0,25 €/kWh (media en España, editable), 1 USD = 0,92 €, 3 tokens de entrada por cada 1 de salida, y la máquina a consumo máximo todas las horas que está encendida (el peor caso). Precios de API verificados el 9-9-2026. No incluye tu tiempo ni el mantenimiento. Ojo: la nube compara con un modelo de frontera y aquí correrías uno abierto más pequeño; es una comparación de coste, no de calidad.
Aprende con esta máquina
- ComfyUI: genera 100 imágenes de producto en minutos con IA localTutorial para usar el workflow de generación por lotes de ComfyUI. Crea imágenes de producto, gráficos para redes sociales y assets de marketing a escala.
- AITune: ajusta la inferencia local en tu tarjeta NVIDIAQué hace de verdad NVIDIA AITune, cuándo usarlo y los ajustes medidos de Ollama y vLLM que aceleran un modelo local en una GPU de consumo o una Jetson.
- Microsoft Phi-4: el pequeño gigante de las matemáticasEn los benchmarks de Microsoft, Phi-4 (14B) logra un 80,4% en MATH, por delante del 74,6% de GPT-4o. Qué necesita para ejecutarse en local y sus límites.
- Cuantización GGUF: elige el archivo correcto para tu máquinaCómo leer el nombre de un archivo GGUF, elegir entre Q4_K_M, Q5 y Q8 según tu memoria y medir tú mismo velocidad, memoria y calidad con tres comandos.
Sáltatela si…
- va a estar encendida todo el día en una oficina: consume hasta 300 W y una GPU de sobremesa hace ruido.
- necesitas modelos de 70B: no caben en esta memoria de GPU.
Ficha y procedencia de los datos
| CPU | AMD Ryzen 5 / Intel i5 |
|---|---|
| GPU | RTX 4060 Ti 16GB |
| NPU | N/A (CUDA cores) |
| Memoria | 16 GB (memoria de GPU (VRAM)); útil para el modelo ≈ 15.5 GB |
| Velocidad | 55 tok/s con 14B estimación del fabricante o la comunidad, no medida por nosotros |
| Precio | ~1.000 € orientativo, revisado 2026-09-19; mira el precio real en la tienda |
Solo publicamos como "medido" lo que corre en nuestras máquinas. Política editorial