Pourquoi héberger un LLM sur son propre VPS en 2026
Exécuter un modèle de langage sur votre propre serveur offre quatre avantages concrets. La confidentialité d'abord : vos données ne quittent jamais le serveur, ce qui rend le dispositif nativement conforme au RGPD sans contrat de sous-traitance complexe. Le coût ensuite : zéro token d'API à payer, une facture VPS fixe et prévisible. La disponibilité garantie : aucune dépendance à un service tiers, pas de quota, pas de panne externe. Enfin, la personnalisation : vous choisissez le modèle, le quantize, les paramètres système, et vous pouvez fine-tuner ou switcher de modèle en une commande.
Ce qu'Ollama vous permet de faire
- Inférence locale — Llama 3.2, Qwen2.5, Phi-3-mini et plus de 150 modèles GGUF prêts à l'emploi
- API OpenAI-compatible — branchez n8n, Open WebUI ou tout client existant sans changer une ligne de code
- Multimodalité — LLaVA et Gemma3 pour l'analyse et la description d'images directement en local
- Agent interactif intégré — v0.32.0 : le terminal Ollama devient un agent capable de coder, chercher et déléguer des sous-tâches
- Modes CPU et GPU — AVX-512 sur EPYC ou Xeon : 8-12 tok/s sans carte graphique sur un VPS 8 Go RAM
Prérequis réalistes pour faire tourner un LLM sur VPS
Pour Phi-3-mini ou Llama 3.2 3B en quantization Q4_K_M, comptez au minimum 4 vCPU, 8 Go de RAM et 20 Go de stockage NVMe. Pour Qwen2.5-7B, montez à 16 Go de RAM. Le système recommandé est Ubuntu 24.04 LTS, qui dispose de toutes les dépendances nécessaires dans ses dépôts. Aucun GPU n'est requis pour les modèles 3B à 7B en Q4_K_M : les jeux d'instructions AVX-512 présents sur les processeurs EPYC et Xeon récents suffisent. Le port 11434 (API Ollama) ne doit être exposé qu'en localhost ; l'accès distant passe obligatoirement par un reverse-proxy.
Déployer Ollama sur VPS en 5 étapes
Installer Ollama
Connectez-vous en SSH sur votre VPS et exécutez le script officiel : curl -fsSL https://ollama.com/install.sh | sh. Le service systemd ollama démarre automatiquement et écoute sur 127.0.0.1:11434.
Télécharger un premier modèle
Tirez Phi-3-mini (2,2 Go, idéal pour démarrer) : ollama pull phi3:mini. Pour un modèle plus capable, utilisez ollama pull llama3.2:3b ou ollama pull qwen2.5:7b selon votre RAM disponible.
Tester en ligne de commande
Lancez une session interactive : ollama run phi3:mini. Tapez votre question et validez. Pour interroger l'API REST : curl http://localhost:11434/api/generate -d '{"model":"phi3:mini","prompt":"Bonjour"}'.
Exposer l'API en HTTPS via Nginx
Installez Nginx et Certbot, créez un vhost sur votre-domaine.com avec proxy_pass http://127.0.0.1:11434;, obtenez un certificat Let's Encrypt avec certbot --nginx -d votre-domaine.com, puis ajoutez une authentification HTTP Basic ou un header Bearer pour protéger l'accès.
Connecter Open WebUI
Déployez Open WebUI (voir l'article dédié) et renseignez l'URL de votre API Ollama sécurisée. ollama serve reste actif comme service systemd : aucune commande manuelle n'est nécessaire après un redémarrage.
Par défaut, Ollama écoute sur OLLAMA_HOST=127.0.0.1, ce qui interdit tout accès externe direct. Ne modifiez jamais cette variable pour écouter sur 0.0.0.0 sans protection : le port 11434 ouvert sur Internet donne un accès complet au modèle et aux fichiers accessibles via l'API. Passez toujours par un reverse-proxy Nginx ou Caddy avec authentification (HTTP Basic ou token Bearer dans l'en-tête Authorization). Vérifiez régulièrement que le port n'est pas exposé : ss -tlnp | grep 11434.
Aller plus loin : construire une stack IA complète
Ollama seul est un moteur d'inférence. Pour construire une stack IA complète et autonome, associez-le à Open WebUI (interface de chat multi-modèles, gestion des conversations et des utilisateurs) et à Dify pour l'orchestration de workflows IA complexes. Ajoutez Gatus pour surveiller la disponibilité de chaque service avec des alertes automatiques. Nos guides dédiés couvrent chaque brique : déployer Open WebUI sur VPS, configurer Dify, et mettre en place Gatus pour le monitoring. En combinant ces trois outils avec Ollama, vous disposez d'une plateforme IA souveraine, sans dépendance à un fournisseur cloud, pour un coût mensuel fixe.