Créer, héberger et exploiter des solutions IA.
Passerelle LLM auto-hébergée — un seul point d'entrée compatible OpenAI qui route vers Ollama, Anthropic et plus de 100 fournisseurs.
LiteLLM est un proxy LLM open source (licence Apache 2.0) qui présente une API unifiée, compatible OpenAI, devant plus de cent fournisseurs de modèles. La différence avec Ollama et LocalAI est structurelle : ces deux-là exécutent les modèles, LiteLLM n'en exécute aucun. Il se place devant eux et arbitre — chaque requête part vers l'Ollama installé sur le même VPS, vers Anthropic Claude, vers Azure OpenAI ou vers n'importe quel autre moteur déclaré, sans qu'une ligne de votre application change. C'est aussi la seule des trois briques d'inférence du catalogue à apporter une couche d'administration : interface web, clés virtuelles, plafonds de dépense et limites de débit par clé.
Déployé sur un VPS ServOrbit, LiteLLM donne à votre équipe une passerelle d'IA privée avec un tableau de bord d'usage intégré. Il tourne en deux conteneurs — la passerelle Python et une base PostgreSQL 16 qui conserve les clés, les journaux de requêtes et les compteurs de dépense — et le service n'est publié que sur la boucle locale du VPS. Cette application demande donc un domaine : c'est par `https://<votre-domaine>` que vos développeurs et vos applications l'atteignent, le vhost nginx et le certificat TLS étant installés par ServOrbit dès que le domaine est attaché. LiteLLM se pose aussi bien devant un Ollama local, pour une inférence entièrement hors ligne, que devant des API commerciales, pour centraliser le suivi des coûts de tous vos projets.
Envoyez les tâches sensibles au coût vers une instance Ollama locale et les requêtes de raisonnement complexe vers Anthropic Claude, depuis le même appel de SDK OpenAI dans votre application. L'arbitrage se change dans la configuration de LiteLLM, jamais dans le code applicatif.
Distribuez une clé d'API virtuelle par équipe ou par projet, avec un plafond de dépense mensuel. Quand une clé atteint son budget, LiteLLM répond par une erreur 429 : plus de facture cloud découverte en fin de mois.
Faites basculer toute votre application d'un fournisseur à un autre en modifiant un fichier de configuration. La surface compatible OpenAI garantit qu'aucun code applicatif ne bouge : passer de GPT-4 à Llama 3 servi par Ollama ne demande pas de toucher à un seul import.
Guide optimisé pour les VPS Cloud ServOrbit.
Un VPS ServOrbit de 1 Go de RAM suffit pour un usage individuel : LiteLLM lui-même consomme environ 256 Mo, PostgreSQL occupe l'essentiel du reste. Comptez 2 Go pour une équipe qui envoie des requêtes en parallèle. Prévoyez également le domaine par lequel la passerelle sera jointe : elle n'est pas atteignable autrement.
Vous n'avez rien à fabriquer à la main : le déploiement génère la clé maître LITELLM_MASTER_KEY, les identifiants de la base PostgreSQL et le mot de passe de l'interface d'administration. La clé maître ouvre le tableau de bord et l'ensemble des points d'entrée d'administration — traitez-la comme un mot de passe et conservez-la hors du serveur.
Ouvrez l'interface d'administration sur https://<votre-domaine>/ui : LiteLLM affiche un formulaire identifiant et mot de passe. Saisissez admin et le mot de passe généré à l'installation, affiché sur la fiche de l'application dans votre espace client, puis créez vos clés virtuelles depuis le tableau de bord.
Deux conteneurs démarrent ensemble : la passerelle ghcr.io/berriai/litellm:main-latest, publiée sur 127.0.0.1:4000, et une base postgres:16-alpine. Les données persistent dans deux volumes, litellm_db pour la base et litellm_config pour la configuration de la passerelle. Comptez une trentaine de secondes au premier démarrage.
Dans le tableau de bord, ouvrez Models puis Add. Pour router vers un Ollama installé sur la même machine, saisissez un nom de modèle du type ollama/llama3.1 avec l'URL de base http://host.docker.internal:11434 ; pour un fournisseur distant, collez la clé d'API correspondante, par exemple pour anthropic/claude-3-5-haiku-20241022. Vérifiez avec curl -H "Authorization: Bearer <LITELLM_MASTER_KEY>" https://<votre-domaine>/v1/models : cette même adresse https://<votre-domaine>/v1 est l'URL de base à donner à vos SDK.
Dans la section API Keys du tableau de bord, créez une clé virtuelle par équipe, avec le cas échéant un max_budget — le budget cumulé, exprimé en dollars —, un tpm_limit en jetons par minute et un rpm_limit en requêtes par minute. Vos développeurs pointent leur SDK OpenAI sur la passerelle, et la dépense est comptabilisée clé par clé.
Vous maintenez un projet qui utilise LiteLLM ? Ce bouton permet à vos lecteurs de le déployer sur un VPS en un clic, sans lire de documentation Docker.
[](https://servorbit.com/vps-cloud?template=litellm&utm_source=deploy-badge&utm_medium=referral&utm_campaign=litellm)<a href="https://servorbit.com/vps-cloud?template=litellm&utm_source=deploy-badge&utm_medium=referral&utm_campaign=litellm"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy LiteLLM on ServOrbit" height="40"></a>Le bouton pointe vers la commande d'un VPS avec le template présélectionné. L'image est servie depuis servorbit.com — rien à héberger de votre côté.
Servez des LLM open source depuis votre propre serveur. Récupérez Llama 3, Mistral, Qwen ou DeepSeek en une commande, derrière une API compatible OpenAI et sans coût au jeton.
Intelligence ArtificielleInterface web pour interagir avec vos LLMs locaux ou distants. Vos données restent sur votre infrastructure — aucun tiers impliqué.
Automatisation & WorkflowsAutomatisez vos workflows entre applications sans code. Plus de 400 intégrations, 100 % auto-hébergé sur votre VPS.
Parcourez notre centre d'aide et notre FAQ, ou contactez notre équipe — rappel, WhatsApp ou e-mail. Support en français, anglais et arabe.