Créer, héberger et exploiter des solutions IA.

Logo Ollama

Ollama

Servez des LLM open source depuis votre VPS — API compatible OpenAI, aucun coût au jeton.

8 Go minimum (16 Go recommandé) RAM 2 vCPU Port 11434 Disponible

Stack technique

DockerGollama.cpp
RAM minimum8 Go minimum (16 Go recommandé)
CPU minimum2 vCPU
Port par défaut11434
OS compatiblesubuntu-24.04

Ollama est un moteur d'inférence open source qui télécharge et sert de grands modèles de langage — Llama 3, Mistral, Qwen, DeepSeek, Gemma — sur votre propre infrastructure, en une seule commande. Il expose une API REST compatible OpenAI : tout outil ou bibliothèque qui sait parler à OpenAI parle à votre instance auto-hébergée sans qu'une ligne de code change. Ce qui le distingue des deux autres briques d'inférence du catalogue tient à son périmètre : Ollama fait une chose, servir des modèles de texte, et il la rend triviale — la gestion des modèles se résume à `ollama pull`, `ollama list` et `ollama rm`, sur une bibliothèque de plus d'une centaine de modèles prêts à l'emploi. LocalAI vise plus large et ajoute images, transcription et embeddings depuis le même conteneur ; LiteLLM, lui, ne calcule rien : c'est une passerelle qui route vers Ollama et vers des fournisseurs distants.

Déployé sur un VPS ServOrbit, Ollama devient votre moteur d'inférence privé : requêtes illimitées à coût mensuel fixe, invites et réponses qui ne quittent jamais votre serveur. Le port n'est publié que sur la boucle locale de la machine — le code qui tourne sur ce même VPS appelle `http://127.0.0.1:11434`, et depuis une autre machine il faut un domaine attaché à l'instance, ou à défaut un tunnel SSH. Ollama n'a ni interface web ni authentification : associez-le à Open WebUI pour une interface de discussion, à LiteLLM pour ajouter des clés et des quotas, ou à n8n et Flowise pour l'automatisation.

Fonctionnalités clés

API compatible OpenAI — changez l'URL de base et votre code existant fonctionne immédiatement
Gestion des modèles en une commande : ollama pull llama3.1:8b, ollama list, ollama rm
Llama 3, Mistral, Qwen, DeepSeek, Gemma, Phi et plus d'une centaine d'autres modèles
Fonctionne sans carte graphique ; le passage à un GPU accélère nettement l'inférence quand la machine en dispose
Serveur multi-modèles : plusieurs modèles chargés en parallèle, chacun avec son propre contexte
Modèles conservés dans un volume Docker — ils survivent au redémarrage du conteneur

Quand utiliser cette solution ?

1

Moteur d'inférence privé

Remplacez vos appels à l'API OpenAI par votre propre point d'entrée Ollama. Une application hébergée sur le même VPS appelle http://127.0.0.1:11434/v1 : vos invites ne sortent jamais de la machine, ce qui convient au traitement de contrats, de documents internes ou de toute donnée sensible.

2

Développement et tests

Faites tourner un modèle de 7 ou 13 milliards de paramètres sur un VPS dédié pour prototyper vos fonctions d'IA avant de brancher un LLM de production. Le coût est fixe, sans facture surprise, et un ollama rm remet la machine à plat.

3

Pile IA partagée par l'équipe

Associez Ollama à Open WebUI pour donner à toute votre équipe une interface de discussion partagée, alimentée par des modèles open source, sur une infrastructure que vous maîtrisez.

Déployer Ollama sur votre VPS

Guide optimisé pour les VPS Cloud ServOrbit.

01

Créer le VPS

Commandez un VPS ServOrbit avec au moins 8 Go de RAM pour un modèle de 7 à 8 milliards de paramètres quantisé en Q4 sur processeur, 16 Go pour des modèles plus gros. Le système installé est Ubuntu 24.04. Pour des temps de réponse dignes de la production, un serveur doté d'un GPU change nettement l'expérience.

02

Déployer Ollama

L'installation depuis votre espace client crée le conteneur ollama/ollama, monte le volume ollama sur /root/.ollama pour que les modèles survivent aux redémarrages, et publie le service sur la boucle locale, en 127.0.0.1:11434. Rien n'est exposé sur Internet à ce stade : c'est volontaire, Ollama n'ayant aucune authentification.

03

Se connecter la première fois

Ollama n'a pas d'écran de connexion : c'est une API HTTP doublée d'une ligne de commande. En SSH sur le VPS, lancez docker exec -it ollama ollama pull llama3 puis docker exec -it ollama ollama run llama3. Branchez ensuite une interface, Open WebUI par exemple, plutôt que d'exposer l'API telle quelle.

04

Télécharger votre premier modèle

Récupérez un modèle avec docker exec -it ollama ollama pull llama3.1:8b, vérifiez qu'il est bien enregistré avec docker exec -it ollama ollama list, puis testez depuis le VPS : curl http://127.0.0.1:11434/api/generate -d '{"model":"llama3.1:8b","prompt":"Bonjour"}'.

05

Tenir compte de l'absence d'authentification

Ollama ne demande aucun identifiant et ne connaît pas la notion de clé d'API : quiconque atteint le service peut interroger vos modèles et en télécharger d'autres. Dès qu'un domaine est attaché, ServOrbit installe le vhost nginx et le certificat TLS — mais le chiffrement protège le transport, il n'identifie personne. Deux options tiennent debout : ne pas attacher de domaine et travailler par tunnel SSH, ou placer devant Ollama une passerelle qui authentifie, LiteLLM par exemple, et ne publier que celle-ci.

06

Brancher vos outils

Dans Open WebUI, Settings puis Connections, indiquez http://localhost:11434. Depuis un SDK OpenAI qui tourne sur le VPS lui-même, réglez base_url='http://127.0.0.1:11434/v1' et api_key='ollama'. Depuis une autre machine, passez par le domaine attaché à l'instance — base_url='https://<votre-domaine>/v1'. Sans domaine, il n'existe aucun point d'entrée public : ouvrez un tunnel SSH avec ssh -L 11434:127.0.0.1:11434 root@<ip-du-vps> puis visez http://localhost:11434/v1. Le port peut être réattribué à l'installation : reprenez celui affiché sur la fiche de l'application dans votre espace client, 11434 n'étant que la valeur du catalogue.

Questions fréquentes

Ollama est un moteur open source qui télécharge et sert de grands modèles de langage derrière une API REST locale. Voyez-le comme un serveur d'inférence installé chez vous : vous récupérez un modèle une fois, et n'importe quelle application l'appelle ensuite comme elle appellerait l'API d'OpenAI.

Intégrer le bouton de déploiement

Vous maintenez un projet qui utilise Ollama ? Ce bouton permet à vos lecteurs de le déployer sur un VPS en un clic, sans lire de documentation Docker.

Deploy Ollama on ServOrbit
Markdown
[![Deploy Ollama on ServOrbit](https://servorbit.com/brand/deploy/button.svg)](https://servorbit.com/vps-cloud?template=ollama&utm_source=deploy-badge&utm_medium=referral&utm_campaign=ollama)
HTML
<a href="https://servorbit.com/vps-cloud?template=ollama&utm_source=deploy-badge&utm_medium=referral&utm_campaign=ollama"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy Ollama on ServOrbit" height="40"></a>

Le bouton pointe vers la commande d'un VPS avec le template présélectionné. L'image est servie depuis servorbit.com — rien à héberger de votre côté.

Créer, héberger et exploiter des solutions IA.

Activez Ollama sur votre infrastructure.

VPS Cloud dédié — IPv4 incluse, datacenter européen, support inclus. Vos données ne quittent jamais votre serveur.

Configuration recommandée : 8 Go minimum (16 Go recommandé) RAM · 2 vCPU

Besoin d'aide ?

Parcourez notre centre d'aide et notre FAQ, ou contactez notre équipe — rappel, WhatsApp ou e-mail. Support en français, anglais et arabe.