Por qué LiteLLM es la capa que falta en las pilas de IA autoalojadas
Ollama es excelente para ejecutar modelos en local. Open WebUI lo viste con una interfaz de chat. Pero en cuanto empieza a construir aplicaciones —y no solo a conversar— necesita un intermediario: un proxy que normalice la superficie de API, siga los costes por proyecto y le permita cambiar de modelo sin tocar el código de la aplicación. Ese es precisamente el papel de LiteLLM. Se interpone entre su aplicación y cualquier backend LLM, exponiendo un único endpoint compatible con OpenAI. Su código no cambia, tanto si dirige las peticiones a Llama 3.1 en Ollama como a Claude 3.5 Haiku o a GPT-4o.
Lo que LiteLLM le aporta desde el primer momento
- API unificada y compatible con OpenAI: funciona con todos los SDK, bibliotecas y herramientas que apuntan a la API de OpenAI.
- Más de 100 integraciones de proveedores: Ollama, Anthropic, OpenAI, Azure OpenAI, Mistral, Cohere, Bedrock y muchos otros.
- Claves de API virtuales con límites de gasto y de tasa por clave: reparta claves entre los equipos y ponga topes a los costes mensuales.
- Panel integrado en /ui con análisis del gasto en tiempo real, desglose por modelo y registros de las peticiones.
- Reparto de carga y conmutación automática entre varios endpoints de proveedores o réplicas de modelos.
- Licencia Apache 2.0: sin telemetría, sin envío de información al exterior, totalmente compatible con entornos air-gap cuando se asocia a Ollama.
Requisitos
Al menos 1 GB de RAM y Ubuntu 22.04. Docker y el plugin Compose instalados. El puerto 4000 abierto, o un reverse proxy Caddy/Nginx para el HTTPS. Eso es todo: LiteLLM es en sí mismo un proxy Python que reclama unos 256 MB; PostgreSQL absorbe la mayor parte del presupuesto de RAM restante. Para equipos que generan tráfico concurrente, 2 GB resultan más cómodos.
Desplegar LiteLLM en un VPS
Aprovisionar el VPS
Contrate un VPS Start (2 vCPU, 4 GB, Ubuntu 22.04): LiteLLM se conforma con 1 GB y el plan más pequeño del catálogo sirve el doble. Conéctese por SSH e instale Docker:
curl -fsSL https://get.docker.com | sh. El plugin Compose viene incluido.Generar los secretos
Ejecute
openssl rand -hex 32para generar LITELLM_MASTER_KEY: es la que desbloquea el panel y todos los endpoints de API de administración. Cree/opt/litellm/.envcon:LITELLM_MASTER_KEY,UI_USERNAME,UI_PASSWORD,DB_NAME=litellm,DB_USER=litellm,DB_PASSWORD=<strong-password>.Redactar docker-compose.yml
Cree
/opt/litellm/docker-compose.ymlcon dos servicios:db(postgres:16-alpine, variables de entorno procedentes del .env, volumen litellm_db) ylitellm(ghcr.io/berriai/litellm:main-latest, puerto 4000:4000, depends_on db, DATABASE_URL + LITELLM_MASTER_KEY + UI_USERNAME + UI_PASSWORD, volumen litellm_config:/app/data). Ejecutedocker compose up -d.Abrir el panel
Vaya a
http://<vps-ip>:4000/uiy conéctese con sus UI_USERNAME / UI_PASSWORD. Llegará al panel de LiteLLM. Entre en Models para añadir su primer proveedor. Para una instancia de Ollama local en el mismo VPS, defina el nombre del modelo comoollama/llama3.1y la API base comohttp://host.docker.internal:11434. Para Anthropic, pegue su clave de API y añadaanthropic/claude-3-5-haiku-20241022.Probar la pasarela
Desde su puesto de trabajo, pruebe:
curl http://<vps-ip>:4000/v1/chat/completions -H "Authorization: Bearer <LITELLM_MASTER_KEY>" -H 'Content-Type: application/json' -d '{"model": "ollama/llama3.1", "messages": [{"role": "user", "content": "Hello"}]}'. Debería recibir una respuesta en streaming, encaminada por LiteLLM hacia su Ollama.Repartir claves de API entre los equipos
En el panel, dentro de API Keys, haga clic en New Key. Póngale una descripción (por ejemplo «frontend-team»), defina
max_budget: 50(USD/mes) y untpm_limitopcional. Comparta esa clave con el equipo: apuntará su SDK de OpenAI ahttp://<vps-ip>:4000y usará esa clave. El gasto se sigue por clave en el panel.Añadir el HTTPS con Caddy
Instale Caddy:
apt install -y caddy. Edite/etc/caddy/Caddyfile:llm.su-dominio.com { reverse_proxy localhost:4000 }. Recargue:systemctl reload caddy. Cierre el puerto 4000 en su firewall: todo el tráfico pasa ya por el 443 con TLS automático.Conectarse por primera vez
Abra la interfaz de administración en /ui: LiteLLM muestra un formulario de usuario y contraseña. Introduzca admin y la contraseña facilitada, y después cree sus claves virtuales desde el panel.
Asocie LiteLLM a Ollama en el mismo VPS para obtener una pila de IA totalmente aislada (air-gap). Ollama se encarga de la inferencia de los modelos; LiteLLM añade la capa de pasarela: encaminamiento, limitación de tasa y seguimiento del consumo. Para las cargas de trabajo sensibles en materia de confidencialidad (jurídico, finanzas, sanidad), esto significa que ningún dato sale de su infraestructura.
La documentación oficial
Para la configuración avanzada y las opciones propias de la herramienta, consulte la documentación oficial de LiteLLM. Esta guía cubre la puesta en línea en un VPS; la documentación del editor sigue siendo la referencia para los ajustes finos, las actualizaciones mayores y los casos de uso específicos.