Créer, héberger et exploiter des solutions IA.

Logo LiteLLM

LiteLLM

Passerelle LLM auto-hébergée — un seul point d'entrée compatible OpenAI qui route vers Ollama, Anthropic et plus de 100 fournisseurs.

1 Go (2 Go recommandé) RAM 2 vCPU Port 4000 Disponible

Stack technique

DockerPythonPostgreSQL 16
RAM minimum1 Go (2 Go recommandé)
CPU minimum2 vCPU
Port par défaut4000
OS compatiblesubuntu-24.04

LiteLLM est un proxy LLM open source (licence Apache 2.0) qui présente une API unifiée, compatible OpenAI, devant plus de cent fournisseurs de modèles. La différence avec Ollama et LocalAI est structurelle : ces deux-là exécutent les modèles, LiteLLM n'en exécute aucun. Il se place devant eux et arbitre — chaque requête part vers l'Ollama installé sur le même VPS, vers Anthropic Claude, vers Azure OpenAI ou vers n'importe quel autre moteur déclaré, sans qu'une ligne de votre application change. C'est aussi la seule des trois briques d'inférence du catalogue à apporter une couche d'administration : interface web, clés virtuelles, plafonds de dépense et limites de débit par clé.

Déployé sur un VPS ServOrbit, LiteLLM donne à votre équipe une passerelle d'IA privée avec un tableau de bord d'usage intégré. Il tourne en deux conteneurs — la passerelle Python et une base PostgreSQL 16 qui conserve les clés, les journaux de requêtes et les compteurs de dépense — et le service n'est publié que sur la boucle locale du VPS. Cette application demande donc un domaine : c'est par `https://<votre-domaine>` que vos développeurs et vos applications l'atteignent, le vhost nginx et le certificat TLS étant installés par ServOrbit dès que le domaine est attaché. LiteLLM se pose aussi bien devant un Ollama local, pour une inférence entièrement hors ligne, que devant des API commerciales, pour centraliser le suivi des coûts de tous vos projets.

Fonctionnalités clés

API REST compatible OpenAI — remplacement direct, compatible avec tous les SDK qui parlent à OpenAI
Plus de 100 fournisseurs : Ollama, Anthropic, OpenAI, Azure, Mistral, Cohere, Bedrock et d'autres
Limites de débit et plafonds de budget par clé — de quoi arrêter une dérive de coût dans un contexte multi-équipes ou multi-projets
Analyse des dépenses en temps réel, avec un détail par modèle et par clé
Répartition de charge et bascule automatique entre plusieurs points d'entrée fournisseurs
Licence Apache 2.0 — entièrement auditable, sans télémétrie, et capable de fonctionner coupé d'Internet avec Ollama

Quand utiliser cette solution ?

1

Backend d'IA multi-modèles

Envoyez les tâches sensibles au coût vers une instance Ollama locale et les requêtes de raisonnement complexe vers Anthropic Claude, depuis le même appel de SDK OpenAI dans votre application. L'arbitrage se change dans la configuration de LiteLLM, jamais dans le code applicatif.

2

Maîtrise du budget IA d'une équipe

Distribuez une clé d'API virtuelle par équipe ou par projet, avec un plafond de dépense mensuel. Quand une clé atteint son budget, LiteLLM répond par une erreur 429 : plus de facture cloud découverte en fin de mois.

3

Changement de fournisseur de LLM

Faites basculer toute votre application d'un fournisseur à un autre en modifiant un fichier de configuration. La surface compatible OpenAI garantit qu'aucun code applicatif ne bouge : passer de GPT-4 à Llama 3 servi par Ollama ne demande pas de toucher à un seul import.

Déployer LiteLLM sur votre VPS

Guide optimisé pour les VPS Cloud ServOrbit.

01

Commander le VPS

Un VPS ServOrbit de 1 Go de RAM suffit pour un usage individuel : LiteLLM lui-même consomme environ 256 Mo, PostgreSQL occupe l'essentiel du reste. Comptez 2 Go pour une équipe qui envoie des requêtes en parallèle. Prévoyez également le domaine par lequel la passerelle sera jointe : elle n'est pas atteignable autrement.

02

Laisser l'installation générer les secrets

Vous n'avez rien à fabriquer à la main : le déploiement génère la clé maître LITELLM_MASTER_KEY, les identifiants de la base PostgreSQL et le mot de passe de l'interface d'administration. La clé maître ouvre le tableau de bord et l'ensemble des points d'entrée d'administration — traitez-la comme un mot de passe et conservez-la hors du serveur.

03

Se connecter la première fois

Ouvrez l'interface d'administration sur https://<votre-domaine>/ui : LiteLLM affiche un formulaire identifiant et mot de passe. Saisissez admin et le mot de passe généré à l'installation, affiché sur la fiche de l'application dans votre espace client, puis créez vos clés virtuelles depuis le tableau de bord.

04

Ce que l'installation déploie

Deux conteneurs démarrent ensemble : la passerelle ghcr.io/berriai/litellm:main-latest, publiée sur 127.0.0.1:4000, et une base postgres:16-alpine. Les données persistent dans deux volumes, litellm_db pour la base et litellm_config pour la configuration de la passerelle. Comptez une trentaine de secondes au premier démarrage.

05

Déclarer votre premier modèle

Dans le tableau de bord, ouvrez Models puis Add. Pour router vers un Ollama installé sur la même machine, saisissez un nom de modèle du type ollama/llama3.1 avec l'URL de base http://host.docker.internal:11434 ; pour un fournisseur distant, collez la clé d'API correspondante, par exemple pour anthropic/claude-3-5-haiku-20241022. Vérifiez avec curl -H "Authorization: Bearer <LITELLM_MASTER_KEY>" https://<votre-domaine>/v1/models : cette même adresse https://<votre-domaine>/v1 est l'URL de base à donner à vos SDK.

06

Distribuer des clés à vos équipes

Dans la section API Keys du tableau de bord, créez une clé virtuelle par équipe, avec le cas échéant un max_budget — le budget cumulé, exprimé en dollars —, un tpm_limit en jetons par minute et un rpm_limit en requêtes par minute. Vos développeurs pointent leur SDK OpenAI sur la passerelle, et la dépense est comptabilisée clé par clé.

Questions fréquentes

LiteLLM est un proxy LLM open source, sous licence Apache 2.0, qui expose une API unifiée compatible OpenAI devant plus de cent fournisseurs de modèles : Ollama, Anthropic Claude, OpenAI GPT-4, Azure OpenAI, Mistral, Cohere et d'autres. Il s'intercale entre vos applications et les moteurs d'inférence, et prend en charge le routage, la limitation de débit et le suivi des coûts.

Intégrer le bouton de déploiement

Vous maintenez un projet qui utilise LiteLLM ? Ce bouton permet à vos lecteurs de le déployer sur un VPS en un clic, sans lire de documentation Docker.

Deploy LiteLLM on ServOrbit
Markdown
[![Deploy LiteLLM on ServOrbit](https://servorbit.com/brand/deploy/button.svg)](https://servorbit.com/vps-cloud?template=litellm&utm_source=deploy-badge&utm_medium=referral&utm_campaign=litellm)
HTML
<a href="https://servorbit.com/vps-cloud?template=litellm&utm_source=deploy-badge&utm_medium=referral&utm_campaign=litellm"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy LiteLLM on ServOrbit" height="40"></a>

Le bouton pointe vers la commande d'un VPS avec le template présélectionné. L'image est servie depuis servorbit.com — rien à héberger de votre côté.

Créer, héberger et exploiter des solutions IA.

Activez LiteLLM sur votre infrastructure.

VPS Cloud dédié — IPv4 incluse, datacenter européen, support inclus. Vos données ne quittent jamais votre serveur.

Configuration recommandée : 1 Go (2 Go recommandé) RAM · 2 vCPU

Besoin d'aide ?

Parcourez notre centre d'aide et notre FAQ, ou contactez notre équipe — rappel, WhatsApp ou e-mail. Support en français, anglais et arabe.