Pourquoi LiteLLM est la couche manquante des stacks d'IA auto-hébergées
Ollama est excellent pour faire tourner des modèles en local. Open WebUI l'habille d'une interface de chat. Mais dès que vous vous mettez à construire des applications — et plus seulement à discuter — il vous faut un intermédiaire : un proxy qui normalise la surface d'API, suit les coûts par projet et vous permet de changer de modèle sans toucher au code applicatif. C'est précisément le rôle de LiteLLM. Il s'intercale entre votre application et n'importe quel backend LLM, en exposant un unique endpoint compatible OpenAI. Votre code reste identique, que vous acheminiez les requêtes vers Llama 3.1 sur Ollama, Claude 3.5 Haiku ou GPT-4o.
Ce que LiteLLM vous apporte d'emblée
- API unifiée et compatible OpenAI — fonctionne avec tous les SDK, bibliothèques et outils qui ciblent l'API d'OpenAI.
- Plus de 100 intégrations de fournisseurs : Ollama, Anthropic, OpenAI, Azure OpenAI, Mistral, Cohere, Bedrock et bien d'autres.
- Clés d'API virtuelles avec limites de dépenses et de débit par clé — distribuez des clés aux équipes et plafonnez les coûts mensuels.
- Tableau de bord intégré sur /ui avec analyse des dépenses en temps réel, ventilation par modèle et journaux des requêtes.
- Répartition de charge et bascule automatique entre plusieurs endpoints de fournisseurs ou réplicas de modèles.
- Licence Apache 2.0 — aucune télémétrie, aucune remontée d'informations vers l'extérieur, entièrement compatible air-gap une fois associée à Ollama.
Prérequis
Un VPS avec au moins 1 Go de RAM et Ubuntu 22.04. Docker et le plugin Compose installés. Le port 4000 ouvert, ou un reverse proxy Caddy/Nginx pour le HTTPS. C'est tout — LiteLLM est lui-même un proxy Python qui réclame environ 256 Mo ; PostgreSQL absorbe l'essentiel du budget RAM restant. Pour des équipes générant du trafic concurrent, 2 Go sont plus confortables.
Déployer LiteLLM sur un VPS
Provisionner le VPS
Commandez un VPS ServOrbit (1 Go de RAM minimum, Ubuntu 22.04). Connectez-vous en SSH et installez Docker : curl -fsSL https://get.docker.com | sh. Le plugin Compose est inclus.
Générer les secrets
Lancez openssl rand -hex 32 pour générer LITELLM_MASTER_KEY — elle déverrouille le tableau de bord et tous les endpoints d'API d'administration. Créez /opt/litellm/.env avec : LITELLM_MASTER_KEY, UI_USERNAME, UI_PASSWORD, DB_NAME=litellm, DB_USER=litellm, DB_PASSWORD=<strong-password>.
Rédiger docker-compose.yml
Créez /opt/litellm/docker-compose.yml avec deux services : db (postgres:16-alpine, variables d'environnement issues du .env, volume litellm_db) et litellm (ghcr.io/berriai/litellm:main-latest, port 4000:4000, depends_on db, DATABASE_URL + LITELLM_MASTER_KEY + UI_USERNAME + UI_PASSWORD, volume litellm_config:/app/data). Lancez docker compose up -d.
Ouvrir le tableau de bord
Rendez-vous sur http://<vps-ip>:4000/ui et connectez-vous avec vos UI_USERNAME / UI_PASSWORD. Vous arrivez sur le tableau de bord de LiteLLM. Allez dans Models pour ajouter votre premier fournisseur. Pour une instance Ollama locale sur le même VPS, définissez le nom du modèle sur ollama/llama3.1 et l'API base sur http://host.docker.internal:11434. Pour Anthropic, collez votre clé d'API et ajoutez anthropic/claude-3-5-haiku-20241022.
Tester la passerelle
Depuis votre poste de travail, testez : curl http://<vps-ip>:4000/v1/chat/completions -H "Authorization: Bearer <LITELLM_MASTER_KEY>" -H 'Content-Type: application/json' -d '{"model": "ollama/llama3.1", "messages": [{"role": "user", "content": "Hello"}]}'. Vous devriez recevoir une réponse en streaming — acheminée par LiteLLM vers votre Ollama.
Distribuer des clés d'API aux équipes
Dans le tableau de bord, sous API Keys, cliquez sur New Key. Donnez-lui une description (par exemple « frontend-team »), définissez max_budget: 50 (USD/mois) et un tpm_limit facultatif. Partagez cette clé avec l'équipe — elle pointe son SDK OpenAI vers http://<vps-ip>:4000 et utilise cette clé. Les dépenses sont suivies par clé dans le tableau de bord.
Ajouter le HTTPS avec Caddy
Installez Caddy : apt install -y caddy. Éditez /etc/caddy/Caddyfile : llm.votre-domaine.com { reverse_proxy localhost:4000 }. Rechargez : systemctl reload caddy. Fermez le port 4000 dans votre pare-feu — tout le trafic passe désormais par le 443 avec TLS automatique.
Se connecter la première fois
Ouvrez l'interface d'administration sur /ui : LiteLLM affiche un formulaire identifiant/mot de passe. Saisissez admin et le mot de passe fourni, puis créez vos clés virtuelles depuis le tableau de bord.
Associez LiteLLM à Ollama sur le même VPS pour une stack d'IA entièrement isolée (air-gap). Ollama assure l'inférence des modèles ; LiteLLM ajoute la couche passerelle — acheminement, limitation de débit et suivi de la consommation. Pour les charges de travail sensibles en matière de confidentialité (juridique, finance, médical), cela signifie qu'aucune donnée ne quitte votre infrastructure.
La documentation officielle
Pour la configuration avancée et les options propres à l'outil, référez-vous à la documentation officielle de LiteLLM. Ce guide couvre la mise en ligne sur VPS ; la doc éditeur reste la référence pour les réglages fins, les mises à jour majeures et les cas d'usage spécifiques.