Para developers

Tu modelo de código, en tu máquina

Misma API que ya usas, sin factura por token y sin que tu código salga de tu red. Diez minutos con Ollama y un modelo de 7B.

41 tok/s qwen2.5-coder:7b · 6,6 GB cargado · medido en nuestra DGX Spark el 4-10-2026

Empieza en 10 minutos

  1. Instala Ollama desde ollama.com.
  2. Descarga el modelo y llama a la API compatible con OpenAI:
ollama pull qwen2.5-coder:7b

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "qwen2.5-coder:7b",
       "messages": [{"role": "user", "content": "Escribe una función en Python que invierta una cadena"}]}'

Desde Python, cambia solo la URL base del cliente oficial de OpenAI:

from openai import OpenAI

# El cliente exige una clave; Ollama la ignora.
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

reply = client.chat.completions.create(
    model="qwen2.5-coder:7b",
    messages=[{"role": "user", "content": "Explica este error: KeyError en la línea 12"}],
)
print(reply.choices[0].message.content)

Cualquier editor o herramienta que acepte una URL base compatible con OpenAI puede apuntar a http://localhost:11434/v1. Con 16 GB de RAM, un modelo de 7B va holgado; para más calidad, mira la clase de 32B en hardware.

Qué pasa en tu máquina

Tu editor habla con una API local idéntica a la de OpenAI; el modelo corre en tu GPU. No hay cable hacia fuera.

La pila local, de tu editor a la GPU Tu editor llama a http://localhost:11434/v1, una API compatible con OpenAI servida por Ollama o vLLM, que ejecuta el modelo en tu GPU. Todo queda dentro de tu máquina. Nada sale de tu máquina Tu editor, agente o script cliente OpenAI con base_url local http://localhost:11434/v1 API compatible con OpenAI Ollama / vLLM el runtime que sirve el modelo qwen2.5-coder:7b 6,6 GB cargado · medido GPU y memoria tu hardware, en tu mesa
¿Cabe el modelo en 16 GB? qwen2.5-coder:7b ocupa 6,6 GB cargado, medido en nuestra máquina, frente a 16 GB de memoria. Cabe con holgura. qwen2.5-coder:7b, cargado 6,6 GB 0 16 GB Cabe con holgura
Medido en nuestra DGX Spark el 4-10-2026. Queda sitio para el sistema y el editor.
En local Ollama en tu máquina API en la nube un proveedor externo
Dónde corre el modelo En tu máquina En el servidor del proveedor
Tu código sale de tu red No Sí
Factura por token No Sí
Funciona sin conexión Sí No
Velocidad medida por nosotros 41 tok/s No la hemos medido; no publicamos cifras ajenas.

Máquinas que mueven un asistente de código

Las más baratas que lo ejecutan con holgura y a una velocidad práctica (misma regla que en el catálogo).

Ver todas las que sirven para código →

Herramientas para agentes, MCP y prompts

Guías para developers