Créer, héberger et exploiter des solutions IA.

Logo LocalAI

LocalAI

Des LLM open source sur processeur, sans GPU — API compatible OpenAI, plus de 200 modèles, auto-hébergés en une commande.

2 Go (4 Go recommandé pour les modèles de 7 milliards de paramètres et plus) RAM 2 vCPU (4 vCPU recommandé) Port 8080 Disponible

Stack technique

DockerGollama.cpp
RAM minimum2 Go (4 Go recommandé pour les modèles de 7 milliards de paramètres et plus)
CPU minimum2 vCPU (4 vCPU recommandé)
Port par défaut8080
OS compatiblesubuntu-24.04

LocalAI (licence MIT, environ 47 k étoiles GitHub) est une alternative libre et gratuite à l'API d'OpenAI. Elle tourne sur du matériel ordinaire, sans carte graphique : un VPS de 2 Go de RAM suffit à servir Llama 3, Mistral, Phi-3, Qwen et plus de deux cents autres modèles derrière une API REST compatible OpenAI. Le code qui appelle aujourd'hui `openai.ChatCompletion.create()` fonctionne sans retouche : vous changez l'URL de base et l'ensemble des appels est traité localement, sans coût au jeton. Face aux deux autres briques d'inférence du catalogue, LocalAI se distingue par son étendue : là où Ollama sert uniquement du texte avec une gestion des modèles en ligne de commande, et où LiteLLM se contente de router sans rien calculer, LocalAI couvre depuis un seul conteneur la génération de texte, l'appel de fonctions, les embeddings, la génération d'images avec Stable Diffusion et la transcription audio avec Whisper — le tout piloté par API, sans ligne de commande dédiée.

Déployé sur un VPS ServOrbit, LocalAI devient le moteur d'inférence privé qu'appellent les applications de votre équipe, vos chaînes RAG et vos cadriciels d'agents à la place d'OpenAI : aucune dépendance à un service tiers, aucune limite d'usage, aucune donnée qui sort de votre infrastructure. LocalAI n'exige aucune clé d'API : le service n'est donc jamais publié derrière un domaine, il reste lié à la boucle locale du VPS. Le code hébergé sur cette même machine vise `http://127.0.0.1:8080` ; depuis ailleurs, l'accès passe par un tunnel SSH.

Fonctionnalités clés

API REST compatible OpenAI — remplacement direct, compatible sans retouche avec les SDK LangChain, LlamaIndex et LiteLLM.
Inférence sur processeur — tourne sur n'importe quel VPS sans GPU grâce à llama.cpp, avec des chemins SIMD optimisés pour Intel et ARM.
Plus de 200 modèles pris en charge — Llama 3, Mistral, Phi-3, Qwen 2.5, DeepSeek, Gemma 2, Falcon, et tout modèle au format GGUF.
Multimodal : génération de texte, appel de fonctions et d'outils, embeddings, génération d'images (Stable Diffusion) et transcription audio (Whisper).
Téléchargement d'un modèle par son nom — curl http://127.0.0.1:8080/models/apply -d '{"id":"llama-3.2-3b-instruct:q4_0"}' récupère et active n'importe quel modèle pris en charge.
Licence MIT — entièrement auditable, sans télémétrie, utilisable coupé d'Internet ; la version 4.6.2, publiée le 6 juillet 2026, ajoute le mode grappe distribuée et un routage tenant compte du cache de préfixes.
Composable avec LiteLLM et Open WebUI — LocalAI fournit la couche d'inférence, LiteLLM ajoute le routage multi-fournisseurs, Open WebUI apporte l'interface de discussion.

Quand utiliser cette solution ?

1

Moteur de LLM privé pour vos applications

Remplacez vos appels à l'API d'OpenAI par un point d'entrée LocalAI sur votre VPS. Votre SaaS, votre outil interne ou votre chaîne RAG envoie exactement le même JSON, avec le même SDK, sans coût au jeton. Le point d'entrée n'est pas public — LocalAI n'écoute que sur la boucle locale, faute de la moindre authentification : du code hébergé sur le VPS lui-même vise http://127.0.0.1:8080/v1/chat/completions, et depuis une autre machine il faut un tunnel SSH. C'est le scénario idéal des usages à fort volume, où la facturation au jeton devient le goulot d'étranglement.

2

Inférence hors ligne pour données sensibles

Pour une application juridique, médicale ou financière dont les données ne doivent pas quitter votre infrastructure, LocalAI fonctionne entièrement hors ligne une fois le modèle téléchargé. Aucune requête n'atteint une API externe, et les fichiers de modèle au format GGUF restent sur votre propre disque, dans un volume Docker.

3

Embeddings et recherche sémantique sans clé d'API

Faites tourner des modèles d'embeddings (nomic-embed-text, mxbai-embed-large) localement, aux côtés de Qdrant sur le même VPS, pour construire une chaîne de recherche sémantique ou de RAG complète. Ni coût d'API d'embeddings, ni donnée qui sort du serveur, ni limite de débit.

Déployer LocalAI sur votre VPS

Guide optimisé pour les VPS Cloud ServOrbit.

01

Créer le VPS

Commandez un VPS ServOrbit avec au moins 2 Go de RAM ; le système installé est Ubuntu 24.04. Pour un usage confortable à plusieurs, ou pour des modèles à partir de 7 milliards de paramètres, 4 Go sont recommandés. Le nombre de cœurs compte pour la vitesse : 4 vCPU réduisent sensiblement la latence de génération sur les modèles de 3 à 7 milliards de paramètres.

02

Déployer LocalAI

L'installation depuis votre espace client crée le conteneur localai/localai:latest, une image d'environ 900 Mo, monte le volume local-ai sur /build/models et publie le serveur d'API compatible OpenAI sur la boucle locale, en 127.0.0.1:8080. Aucun modèle n'est fourni : la première demande portant sur un modèle déclenche son téléchargement dans le volume persistant.

03

Se connecter la première fois

LocalAI s'ouvre sans aucun identifiant : votre première action consiste à passer par la galerie de modèles pour en télécharger un, l'installation n'en fournissant aucun. L'API compatible OpenAI répond à la même adresse et n'est protégée par aucune clé — tant que le service n'écoute que sur la boucle locale, seuls les utilisateurs disposant d'un accès SSH au VPS peuvent l'atteindre.

04

Télécharger un modèle

Un seul appel d'API suffit : curl http://127.0.0.1:8080/models/apply -H 'Content-Type: application/json' -d '{"id":"llama-3.2-3b-instruct:q4_0"}'. LocalAI récupère le fichier GGUF et enregistre le modèle. La quantisation Q4 d'un modèle de 3 milliards de paramètres tient dans 2 Go de RAM ; celle d'un modèle de 7 milliards en réclame environ 4.

05

Passer votre premier appel d'API

Testez l'API depuis le VPS : curl http://127.0.0.1:8080/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"llama-3.2-3b-instruct:q4_0","messages":[{"role":"user","content":"Bonjour !"}]}'. La réponse a exactement la forme de celle d'OpenAI : changer l'URL de base dans votre code existant suffit à le faire fonctionner.

06

Brancher vos applications sur LocalAI

Depuis le VPS lui-même, réglez base_url='http://127.0.0.1:8080/v1' et api_key='not-needed' dans n'importe quel SDK OpenAI — c'est le cas d'usage normal, l'application qui consomme LocalAI tournant sur la même machine. Depuis votre poste, ouvrez un tunnel SSH — ssh -L 8080:127.0.0.1:8080 root@<ip-du-vps> — et visez http://localhost:8080/v1. Le port peut être réattribué à l'installation : reprenez celui affiché sur la fiche de l'application dans votre espace client, 8080 n'étant que la valeur du catalogue. Dans LangChain, cela donne ChatOpenAI(base_url=..., api_key='x') ; dans LiteLLM, préfixez le modèle par localai/ ; dans Open WebUI, déclarez une connexion OpenAI avec cette même URL de base. Votre code existant n'a besoin d'aucune autre modification.

07

Protéger le point d'entrée

LocalAI est ouvert par défaut : aucune clé n'est exigée. L'application sait en réclamer une par la variable d'environnement LOCALAI_API_KEY, mais l'installation du catalogue n'en pose pas — le point d'entrée est donc non authentifié, et c'est pour cette raison qu'il n'est pas publié derrière un domaine : un moteur d'inférence ouvert sur Internet, c'est votre GPU et votre facture à la disposition de qui le trouve. Pour exposer une API publique, publiez à la place une passerelle qui authentifie — LiteLLM par exemple — et laissez LocalAI derrière elle, sur la boucle locale.

Questions fréquentes

LocalAI est un serveur libre et gratuit, sous licence MIT, qui exécute de grands modèles de langage localement sur processeur. Il expose une API REST compatible OpenAI : votre code existant fonctionne sans modification, il suffit de remplacer l'URL de base de l'API par celle de votre serveur.

Intégrer le bouton de déploiement

Vous maintenez un projet qui utilise LocalAI ? Ce bouton permet à vos lecteurs de le déployer sur un VPS en un clic, sans lire de documentation Docker.

Deploy LocalAI on ServOrbit
Markdown
[![Deploy LocalAI on ServOrbit](https://servorbit.com/brand/deploy/button.svg)](https://servorbit.com/vps-cloud?template=local-ai&utm_source=deploy-badge&utm_medium=referral&utm_campaign=local-ai)
HTML
<a href="https://servorbit.com/vps-cloud?template=local-ai&utm_source=deploy-badge&utm_medium=referral&utm_campaign=local-ai"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy LocalAI on ServOrbit" height="40"></a>

Le bouton pointe vers la commande d'un VPS avec le template présélectionné. L'image est servie depuis servorbit.com — rien à héberger de votre côté.

Créer, héberger et exploiter des solutions IA.

Activez LocalAI sur votre infrastructure.

VPS Cloud dédié — IPv4 incluse, datacenter européen, support inclus. Vos données ne quittent jamais votre serveur.

Configuration recommandée : 2 Go (4 Go recommandé pour les modèles de 7 milliards de paramètres et plus) RAM · 2 vCPU (4 vCPU recommandé)

Besoin d'aide ?

Parcourez notre centre d'aide et notre FAQ, ou contactez notre équipe — rappel, WhatsApp ou e-mail. Support en français, anglais et arabe.

Écrire sur WhatsApps'ouvre dans un nouvel onglet