Créer, héberger et exploiter des solutions IA.

Des LLM open source sur processeur, sans GPU — API compatible OpenAI, plus de 200 modèles, auto-hébergés en une commande.
LocalAI (licence MIT, environ 47 k étoiles GitHub) est une alternative libre et gratuite à l'API d'OpenAI. Elle tourne sur du matériel ordinaire, sans carte graphique : un VPS de 2 Go de RAM suffit à servir Llama 3, Mistral, Phi-3, Qwen et plus de deux cents autres modèles derrière une API REST compatible OpenAI. Le code qui appelle aujourd'hui `openai.ChatCompletion.create()` fonctionne sans retouche : vous changez l'URL de base et l'ensemble des appels est traité localement, sans coût au jeton. Face aux deux autres briques d'inférence du catalogue, LocalAI se distingue par son étendue : là où Ollama sert uniquement du texte avec une gestion des modèles en ligne de commande, et où LiteLLM se contente de router sans rien calculer, LocalAI couvre depuis un seul conteneur la génération de texte, l'appel de fonctions, les embeddings, la génération d'images avec Stable Diffusion et la transcription audio avec Whisper — le tout piloté par API, sans ligne de commande dédiée.
Déployé sur un VPS ServOrbit, LocalAI devient le moteur d'inférence privé qu'appellent les applications de votre équipe, vos chaînes RAG et vos cadriciels d'agents à la place d'OpenAI : aucune dépendance à un service tiers, aucune limite d'usage, aucune donnée qui sort de votre infrastructure. LocalAI n'exige aucune clé d'API : le service n'est donc jamais publié derrière un domaine, il reste lié à la boucle locale du VPS. Le code hébergé sur cette même machine vise `http://127.0.0.1:8080` ; depuis ailleurs, l'accès passe par un tunnel SSH.
curl http://127.0.0.1:8080/models/apply -d '{"id":"llama-3.2-3b-instruct:q4_0"}' récupère et active n'importe quel modèle pris en charge.Remplacez vos appels à l'API d'OpenAI par un point d'entrée LocalAI sur votre VPS. Votre SaaS, votre outil interne ou votre chaîne RAG envoie exactement le même JSON, avec le même SDK, sans coût au jeton. Le point d'entrée n'est pas public — LocalAI n'écoute que sur la boucle locale, faute de la moindre authentification : du code hébergé sur le VPS lui-même vise http://127.0.0.1:8080/v1/chat/completions, et depuis une autre machine il faut un tunnel SSH. C'est le scénario idéal des usages à fort volume, où la facturation au jeton devient le goulot d'étranglement.
Pour une application juridique, médicale ou financière dont les données ne doivent pas quitter votre infrastructure, LocalAI fonctionne entièrement hors ligne une fois le modèle téléchargé. Aucune requête n'atteint une API externe, et les fichiers de modèle au format GGUF restent sur votre propre disque, dans un volume Docker.
Faites tourner des modèles d'embeddings (nomic-embed-text, mxbai-embed-large) localement, aux côtés de Qdrant sur le même VPS, pour construire une chaîne de recherche sémantique ou de RAG complète. Ni coût d'API d'embeddings, ni donnée qui sort du serveur, ni limite de débit.
Guide optimisé pour les VPS Cloud ServOrbit.
Commandez un VPS ServOrbit avec au moins 2 Go de RAM ; le système installé est Ubuntu 24.04. Pour un usage confortable à plusieurs, ou pour des modèles à partir de 7 milliards de paramètres, 4 Go sont recommandés. Le nombre de cœurs compte pour la vitesse : 4 vCPU réduisent sensiblement la latence de génération sur les modèles de 3 à 7 milliards de paramètres.
L'installation depuis votre espace client crée le conteneur localai/localai:latest, une image d'environ 900 Mo, monte le volume local-ai sur /build/models et publie le serveur d'API compatible OpenAI sur la boucle locale, en 127.0.0.1:8080. Aucun modèle n'est fourni : la première demande portant sur un modèle déclenche son téléchargement dans le volume persistant.
LocalAI s'ouvre sans aucun identifiant : votre première action consiste à passer par la galerie de modèles pour en télécharger un, l'installation n'en fournissant aucun. L'API compatible OpenAI répond à la même adresse et n'est protégée par aucune clé — tant que le service n'écoute que sur la boucle locale, seuls les utilisateurs disposant d'un accès SSH au VPS peuvent l'atteindre.
Un seul appel d'API suffit : curl http://127.0.0.1:8080/models/apply -H 'Content-Type: application/json' -d '{"id":"llama-3.2-3b-instruct:q4_0"}'. LocalAI récupère le fichier GGUF et enregistre le modèle. La quantisation Q4 d'un modèle de 3 milliards de paramètres tient dans 2 Go de RAM ; celle d'un modèle de 7 milliards en réclame environ 4.
Testez l'API depuis le VPS : curl http://127.0.0.1:8080/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"llama-3.2-3b-instruct:q4_0","messages":[{"role":"user","content":"Bonjour !"}]}'. La réponse a exactement la forme de celle d'OpenAI : changer l'URL de base dans votre code existant suffit à le faire fonctionner.
Depuis le VPS lui-même, réglez base_url='http://127.0.0.1:8080/v1' et api_key='not-needed' dans n'importe quel SDK OpenAI — c'est le cas d'usage normal, l'application qui consomme LocalAI tournant sur la même machine. Depuis votre poste, ouvrez un tunnel SSH — ssh -L 8080:127.0.0.1:8080 root@<ip-du-vps> — et visez http://localhost:8080/v1. Le port peut être réattribué à l'installation : reprenez celui affiché sur la fiche de l'application dans votre espace client, 8080 n'étant que la valeur du catalogue. Dans LangChain, cela donne ChatOpenAI(base_url=..., api_key='x') ; dans LiteLLM, préfixez le modèle par localai/ ; dans Open WebUI, déclarez une connexion OpenAI avec cette même URL de base. Votre code existant n'a besoin d'aucune autre modification.
LocalAI est ouvert par défaut : aucune clé n'est exigée. L'application sait en réclamer une par la variable d'environnement LOCALAI_API_KEY, mais l'installation du catalogue n'en pose pas — le point d'entrée est donc non authentifié, et c'est pour cette raison qu'il n'est pas publié derrière un domaine : un moteur d'inférence ouvert sur Internet, c'est votre GPU et votre facture à la disposition de qui le trouve. Pour exposer une API publique, publiez à la place une passerelle qui authentifie — LiteLLM par exemple — et laissez LocalAI derrière elle, sur la boucle locale.
Vous maintenez un projet qui utilise LocalAI ? Ce bouton permet à vos lecteurs de le déployer sur un VPS en un clic, sans lire de documentation Docker.
[](https://servorbit.com/vps-cloud?template=local-ai&utm_source=deploy-badge&utm_medium=referral&utm_campaign=local-ai)<a href="https://servorbit.com/vps-cloud?template=local-ai&utm_source=deploy-badge&utm_medium=referral&utm_campaign=local-ai"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy LocalAI on ServOrbit" height="40"></a>Le bouton pointe vers la commande d'un VPS avec le template présélectionné. L'image est servie depuis servorbit.com — rien à héberger de votre côté.
Servez des LLM open source depuis votre propre serveur. Récupérez Llama 3, Mistral, Qwen ou DeepSeek en une commande, derrière une API compatible OpenAI et sans coût au jeton.
Intelligence ArtificiellePasserelle d'API auto-hébergée pour plus de 100 fournisseurs de LLM : un point d'entrée unique compatible OpenAI qui route vers Ollama, Anthropic, Azure et les autres, avec clés virtuelles, quotas et suivi des dépenses.
Intelligence ArtificielleInterface web pour interagir avec vos LLMs locaux ou distants. Vos données restent sur votre infrastructure — aucun tiers impliqué.
Créer, héberger et exploiter des solutions IA.
VPS Cloud dédié — IPv4 incluse, datacenter européen, support inclus. Vos données ne quittent jamais votre serveur.
Configuration recommandée : 2 Go (4 Go recommandé pour les modèles de 7 milliards de paramètres et plus) RAM · 2 vCPU (4 vCPU recommandé)
Parcourez notre centre d'aide et notre FAQ, ou contactez notre équipe — rappel, WhatsApp ou e-mail. Support en français, anglais et arabe.
Écrire sur WhatsApps'ouvre dans un nouvel onglet