Por qué el cambio a los AI Credits lo cambia todo
Hasta el 31 de mayo de 2026, Copilot Pro+ facturaba un importe fijo al mes, sin importar el volumen de peticiones. Desde el 1 de junio, cada plan de Copilot incluye un presupuesto mensual en AI Credits que se convierte en tokens según el modelo utilizado. El resultado medido por los primeros usuarios: una sesión agéntica de dos horas bastó para consumir el 8 % de la cuota mensual del plan Pro+, con una cuota estimada en 7000 créditos que se agota en menos de dos días a ese ritmo. El problema no es el precio por petición: es que ya no existe un importe fijo de base. Un flujo de trabajo agéntico que abre varios archivos, llama a herramientas e itera consume un múltiplo de lo que usaría un simple autocompletado. La previsibilidad, que era la promesa de la tarifa plana, ya no existe.
Seis razones para pasar a un asistente de código self-hosted
- Costo mensual fijo: un VPS con Ollama cuesta lo mismo cada mes, sea cual sea la carga agéntica.
- Confidencialidad de los prompts: ninguna línea de código ni ningún contexto de proyecto sale de su infraestructura.
- Libre elección del modelo: Qwen2.5-Coder, DeepSeek Coder, Llama 3.2 o cualquier modelo en formato GGUF disponible a través de Ollama.
- Sin cuota por sesión: nada de degradación ni de bloqueo a fin de mes.
- Portabilidad: el mismo servidor Ollama alimenta VS Code, JetBrains, Neovim o un pipeline de CI.
- Independencia de las decisiones de precios: los cambios de precio o de política de GitHub ya no afectan a su asistente de código.
Requisitos con cifras
Para ejecutar un modelo 7B cuantizado en Q4_K_M — el formato recomendado para un buen equilibrio entre calidad y rendimiento — cuente con un mínimo de 4 GB de RAM dedicados al proceso Ollama. Con 8 GB, el modelo permanece en memoria entre peticiones y evita la recarga. Para los modelos 14B, apunte a 16 GB.
En cuanto al software: Docker y Docker Compose instalados en el VPS, un subdominio (p. ej. ollama.su-dominio.com) apuntando a la IP del VPS, y el puerto 443 abierto. No se requiere ninguna tarjeta gráfica: un modelo 7B en Q4_K_M funciona en CPU a entre 5 y 15 tokens por segundo según el número de vCPU, suficiente para el autocompletado de funciones y el chat interactivo.
Opción 1 — Continue.dev + Ollama: la configuración en cinco minutos
Continue.dev se instala como cualquier otra extensión de VS Code. Lee un archivo config.json para saber a qué modelo conectarse. Ese modelo puede ser local o remoto — es este segundo caso el que nos interesa: su VPS aloja el motor de inferencia, su equipo aloja el IDE. La cadena completa: extensión de VS Code → ~/.continue/config.json → URL HTTPS del reverse proxy → puerto 11434 de Ollama en el VPS.
Desplegar Continue.dev + Ollama en un VPS
Aprovisionar el VPS e instalar Docker
Conéctese por SSH, actualice el sistema y luego instale Docker con el instalador oficial:
curl -fsSL https://get.docker.com | shCompruébelo con
docker compose version. Cree una carpeta dedicada:mkdir -p /opt/ollama.Iniciar Ollama y descargar un modelo
Lance el contenedor oficial exponiendo el puerto únicamente en localhost:
docker run -d --name ollama -p 127.0.0.1:11434:11434 -v ollama:/root/.ollama ollama/ollamaDescargue un modelo orientado a código:
docker exec ollama ollama pull qwen2.5-coder:7b-instruct-q4_K_M. La descarga tarda unos minutos según la conexión.Configurar el reverse proxy con TLS
No exponga nunca el puerto 11434 directamente en Internet: Ollama no tiene ninguna autenticación nativa. Con Caddy, basta una directiva en el Caddyfile para terminar TLS y redirigir hacia
localhost:11434. Añada una autenticación básica o una cabecera secreta para restringir el acceso. Cierre el puerto directo:ufw deny 11434.Instalar Continue.dev en VS Code
Abra el panel de Extensiones (
Ctrl+Shift+X), busque Continue y haga clic en Instalar. La extensión añade un icono en la barra lateral. Abra~/.continue/config.json(macOS/Linux) desde el icono de engranaje del panel Continue.Editar config.json para apuntar al VPS
En el array
models, añada una entrada de tipoollamacon el campoapiBaseapuntando a la URL HTTPS de su reverse proxy. Rellene también el campomodelcon el nombre exacto del modelo descargado (qwen2.5-coder:7b-instruct-q4_K_M). Guarde: Continue.dev recarga la configuración sin reiniciar.Probar el autocompletado desde VS Code
Abra un archivo de código, coloque el cursor después de una firma de función parcial y espere el autocompletado en línea. O abra el panel de chat de Continue y haga una pregunta sobre su base de código. La respuesta proviene de su VPS: ningún prompt pasa por los servidores de GitHub.
Opción 2 — Tabby: servidor de autocompletado dedicado para un equipo
Tabby es un servidor de autocompletado de código autoalojado con alrededor de 33 800 estrellas en GitHub y una licencia Apache 2.0 para el núcleo de código abierto. Expone una API compatible con los plugins oficiales de VS Code, JetBrains y Neovim, y gestiona la autenticación por token: cada desarrollador obtiene una clave individual. Esa es la diferencia principal con Ollama + Continue.dev: Tabby está diseñado para servir a varios puestos de trabajo desde un único servidor, con una interfaz de administración y registros de uso por desarrollador.
Desplegar Tabby con Docker Compose
Crear el archivo Docker Compose
Defina el servicio con la imagen oficial
tabbyml/tabby. Para un uso solo con CPU, omita las opciones de GPU y elija un modelo compacto como argumento de arranque:--model StarCoder2-3Bo--model Qwen2.5-Coder-1.5B. Monte un volumen para conservar los modelos descargados entre reinicios y exponga el puerto 8080 únicamente en127.0.0.1.Iniciar el servidor y esperar la carga del modelo
Ejecute
docker compose up -dy luego siga los logs:docker compose logs -f tabby. El modelo se descarga en el primer arranque. Tabby confirma que está operativo cuando muestra el puerto de escucha en los logs.Configurar el reverse proxy y activar la autenticación
Apunte un subdominio a
localhost:8080mediante Caddy o Nginx Proxy Manager con TLS. En la interfaz de administración de Tabby, active la gestión de usuarios, cree la cuenta de administrador y genere tokens de acceso individuales para cada desarrollador.Instalar el plugin de VS Code e introducir el token
En VS Code, instale la extensión Tabby disponible en el Marketplace. Introduzca la URL de su servidor (p. ej.
https://tabby.su-dominio.com) y el token personal en los ajustes de la extensión. El autocompletado en línea se activa de inmediato en todos los archivos abiertos.
LiteLLM como pasarela multimodelo
Si orquesta varias fuentes de modelos — Ollama en un VPS para el trabajo diario, una API externa para las tareas complejas — LiteLLM lo unifica todo detrás de un único punto de entrada compatible con OpenAI. Continue.dev o cualquier cliente que hable OpenAI apunta a LiteLLM, que enruta hacia el backend adecuado según reglas de prioridad o de presupuesto.
Usted define topes de gasto por clave API, fallbacks automáticos en caso de error de un proveedor y una rotación entre modelos desde un archivo de configuración central. La plantilla VPS LiteLLM del catálogo ServOrbit despliega el proxy y su base de datos PostgreSQL con un solo comando. Es la capa indicada si quiere conservar la posibilidad de cambiar a un modelo en la nube sin modificar la configuración de su editor.
No exponga nunca Ollama directamente en Internet. Cierre el puerto 11434 con ufw deny 11434 y deje que solo el reverse proxy se conecte a él en local. Si varias personas comparten el mismo servidor Ollama, LiteLLM añade por encima una capa de gestión de claves API individuales, sin modificar la configuración de Ollama: cada desarrollador tiene su token de LiteLLM, y LiteLLM habla con Ollama internamente.
Resolución de problemas
Timeout de Ollama en la primera llamada. Compruebe que el contenedor está en marcha (docker ps) y que el modelo está cargado (docker exec ollama ollama list). Un modelo 7B puede tardar de 30 a 60 segundos en cargarse en memoria en la primera llamada tras un reinicio del contenedor.
Modelo demasiado pesado para la RAM disponible. Vigile docker stats para seguir el uso de memoria. Pase a una cuantización más ligera (Q3_K_M o Q2_K) o a un modelo más compacto (1.5B o 3B).
Continue.dev no encuentra la API. Compruebe que apiBase en config.json apunta a la URL HTTPS de su reverse proxy y no a localhost:11434. Pruebe con curl -I https://ollama.su-dominio.com para confirmar que el certificado TLS es válido y que el servidor responde.
Latencia elevada solo con CPU. En un modelo 7B en Q4 sin GPU, cuente entre 5 y 15 tokens por segundo según el número de vCPU. Reduzca el contexto enviado a Continue.dev limitando el número de archivos abiertos incluidos en el índice (parámetro contextLength).
Lo que cambia en la práctica
El paso de Copilot a los AI Credits ha vuelto variable la facturación justo cuando las sesiones agénticas son las que más consumen. Un VPS con Ollama responde con un costo mensual fijo, un control total sobre los modelos utilizados y prompts que se quedan en su infraestructura.
Continue.dev cubre el caso individual en cinco minutos sin cambiar de IDE. Tabby cubre el caso de equipo con autenticación por token y administración centralizada. LiteLLM se intercala si orquesta varias fuentes de modelos desde un punto único. Estas tres herramientas son complementarias, no competidoras: la elección depende del número de desarrolladores, de la necesidad de auditoría y de la diversidad de modelos que orquestar.