[{"data":1,"prerenderedAt":160},["ShallowReactive",2],{"seo-verification":3,"blog-github-copilot-ai-credits-alternative-vps-fr":6},{"google":4,"bing":5},"EycwPY2XMyTkVzas3n1ygeNJFGAH513qrMjfDljzsMQ","",{"id":7,"slug":8,"slugs":9,"title":12,"excerpt":13,"readTime":14,"views":15,"isPinned":16,"publishedAt":17,"category":18,"categories":24,"featuredImage":26,"bgImage":27,"posterImage":28,"relatedSolution":29,"intro":31,"sections":32,"ctaTitle":105,"ctaBody":106,"ctaButton":107,"ctaUrl":108,"relatedPosts":109},271,"github-copilot-ai-credits-alternative-vps",{"fr":8,"en":10,"ar":11},"github-copilot-ai-credits-take-back-control-with-a-vps","github-copilot-ai-credits-استعد-السيطرة-مع-خادم-vps","GitHub Copilot AI Credits : reprendre le contrôle sur un VPS","Depuis juin 2026, Copilot facture en AI Credits et la prévisibilité disparaît. Hébergez Ollama ou Tabby sur un VPS : coût fixe, invites privées.",8,0,false,"2026-08-16T00:00:00+00:00",{"id":19,"name":20,"slug":21,"color":22,"icon":23},1,"Intelligence Artificielle","intelligence-artificielle","bg-purple-500\u002F10 text-purple-400","ia",[25],{"id":19,"name":20,"slug":21,"color":22,"icon":23},null,"\u002Fblog\u002Fcovers\u002Fbg.svg","\u002Fblog\u002Fcovers\u002Fgithub-copilot-ai-credits-alternative-vps-poster.svg",{"categorySlug":23,"appSlug":30},"ollama","Depuis le 1ᵉʳ juin 2026, GitHub Copilot facture en AI Credits — des unités indexées sur la consommation de tokens. Dès le premier jour, des développeurs Pro+ ont consommé 8 % de leur quota mensuel de 7 000 crédits en deux heures lors de sessions agentiques ordinaires. La prévisibilité disparaît au moment précis où l’usage monte. Une alternative directe existe : héberger son propre moteur d’inférence sur un VPS, brancher VS Code dessus via Continue.dev, et retrouver un coût mensuel fixe sans qu’une seule invite ne quitte votre serveur.",[33,37,47,50,53,75,78,93,96,99,102],{"type":34,"title":35,"body":36},"h2","Pourquoi le passage aux AI Credits change la donne","Jusqu’au 31 mai 2026, Copilot Pro+ facturait un montant forfaitaire par mois, quel que soit le volume de requêtes. Depuis le 1ᵉʳ juin, chaque plan Copilot inclut un budget mensuel en AI Credits converti en tokens selon le modèle utilisé. Le résultat mesuré par les premiers utilisateurs : une session agentique de deux heures a suffi à consommer 8 % du quota mensuel sur le plan Pro+, avec un quota estimé à 7 000 crédits épuisable en moins de deux jours à ce rythme. Le problème n’est pas le prix par requête : c’est l’absence de plancher. Un workflow agentique qui ouvre plusieurs fichiers, appelle des outils et itère consomme un multiple de ce qu’une complétion simple utiliserait. La prévisibilité, qui était la promesse du forfait, n’existe plus.",{"type":38,"title":39,"items":40},"ul","Six raisons de basculer vers un assistant de code self-hosted",[41,42,43,44,45,46],"**Coût mensuel fixe** : un VPS avec Ollama coûte le même montant chaque mois, quelle que soit la charge agentique.","**Confidentialité des invites** : aucune ligne de code, aucun contexte de projet ne quitte votre infrastructure.","**Choix libre du modèle** : Qwen2.5-Coder, DeepSeek Coder, Llama 3.2 ou tout modèle au format GGUF disponible via Ollama.","**Aucun quota par session** : pas de dégradation ni de blocage en fin de mois.","**Portabilité** : le même serveur Ollama alimente VS Code, JetBrains, Neovim ou une pipeline CI.","**Indépendance des décisions tarifaires** : les changements de prix ou de politique de GitHub ne touchent plus votre assistant de code.",{"type":34,"title":48,"body":49},"Prérequis chiffrés","Pour faire tourner un modèle 7B quantifié en Q4_K_M — le format recommandé pour un bon équilibre qualité\u002Fperformance — comptez **au minimum 4 Go de RAM dédiés au processus Ollama**. Avec 8 Go, le modèle reste en mémoire entre les requêtes et évite le rechargement. Pour les modèles 14B, visez 16 Go.\n\nCôté logiciel : Docker et Docker Compose installés sur le VPS, un sous-domaine (ex. `ollama.votre-domaine.com`) pointant vers l’IP du VPS, et le port 443 ouvert. Aucune carte graphique n’est requise : un modèle 7B en Q4_K_M tourne sur CPU à 5 à 15 tokens par seconde selon le nombre de vCPU, suffisant pour les complétions de fonctions et le chat interactif.",{"type":34,"title":51,"body":52},"Option 1 — Continue.dev + Ollama : le setup en cinq minutes","Continue.dev s’installe comme n’importe quelle extension VS Code. Il lit un fichier `config.json` pour savoir à quel modèle se connecter. Ce modèle peut être local ou distant — c’est ce second cas qui nous intéresse : votre VPS héberge le moteur d’inférence, votre poste héberge l’IDE. La chaîne complète : extension VS Code → `~\u002F.continue\u002Fconfig.json` → URL HTTPS du reverse proxy → port `11434` de Ollama sur le VPS.",{"type":54,"title":55,"steps":56},"steps","Déployer Continue.dev + Ollama sur VPS",[57,60,63,66,69,72],{"title":58,"body":59},"Provisionner le VPS et installer Docker","Connectez-vous en SSH, mettez le système à jour, puis installez Docker avec l’installateur officiel :\n```bash\ncurl -fsSL https:\u002F\u002Fget.docker.com | sh\n```\nVérifiez avec `docker compose version`. Créez un dossier dédié : `mkdir -p \u002Fopt\u002Follama`.",{"title":61,"body":62},"Démarrer Ollama et télécharger un modèle","Lancez le conteneur officiel en n’exposant le port que sur localhost :\n```bash\ndocker run -d --name ollama -p 127.0.0.1:11434:11434 -v ollama:\u002Froot\u002F.ollama ollama\u002Follama\n```\nTéléchargez un modèle orienté code : `docker exec ollama ollama pull qwen2.5-coder:7b-instruct-q4_K_M`. Le téléchargement prend quelques minutes selon la connexion.",{"title":64,"body":65},"Configurer le reverse proxy avec TLS","N’exposez jamais le port 11434 directement sur Internet — Ollama n’a aucune authentification native. Avec Caddy, une directive suffit dans le Caddyfile pour terminer TLS et relayer vers `localhost:11434`. Ajoutez une authentification basique ou un en-tête secret pour restreindre l’accès. Fermez le port en direct : `ufw deny 11434`.",{"title":67,"body":68},"Installer Continue.dev dans VS Code","Ouvrez le panneau Extensions (`Ctrl+Shift+X`), cherchez **Continue**, cliquez Installer. L’extension ajoute une icône dans la barre latérale. Ouvrez `~\u002F.continue\u002Fconfig.json` (macOS\u002FLinux) via l’icône engrenage du panneau Continue.",{"title":70,"body":71},"Éditer config.json pour pointer vers le VPS","Dans le tableau `models`, ajoutez une entrée de type `ollama` avec le champ `apiBase` pointant vers l’URL HTTPS de votre reverse proxy. Renseignez aussi le champ `model` avec le nom exact du modèle téléchargé (`qwen2.5-coder:7b-instruct-q4_K_M`). Sauvegardez : Continue.dev recharge la configuration sans redémarrage.",{"title":73,"body":74},"Tester la complétion depuis VS Code","Ouvrez un fichier de code, placez le curseur après une signature de fonction partielle et attendez la complétion inline. Ou ouvrez le panneau chat Continue et posez une question sur votre base de code. La réponse provient de votre VPS — aucune invite ne transite par les serveurs GitHub.",{"type":34,"title":76,"body":77},"Option 2 — Tabby : serveur de complétion dédié pour une équipe","Tabby est un serveur de complétion de code auto-hébergé avec environ 33 800 étoiles GitHub et une licence Apache 2.0 pour le noyau open source. Il expose une API compatible avec les plugins officiels de VS Code, JetBrains et Neovim, et gère l’authentification par token : chaque développeur obtient une clé individuelle. C’est la différence principale avec Ollama + Continue.dev : Tabby est conçu pour servir plusieurs postes depuis un seul serveur, avec une interface d’administration et des journaux d’utilisation par développeur.",{"type":54,"title":79,"steps":80},"Déployer Tabby avec Docker Compose",[81,84,87,90],{"title":82,"body":83},"Créer le fichier Docker Compose","Définissez le service avec l’image officielle `tabbyml\u002Ftabby`. Pour un usage CPU uniquement, omettez les options GPU et choisissez un modèle compact en argument de démarrage : `--model StarCoder2-3B` ou `--model Qwen2.5-Coder-1.5B`. Montez un volume pour conserver les modèles téléchargés entre les redémarrages et exposez le port 8080 uniquement sur `127.0.0.1`.",{"title":85,"body":86},"Démarrer le serveur et attendre le chargement du modèle","Lancez `docker compose up -d` puis suivez les logs : `docker compose logs -f tabby`. Le modèle se télécharge au premier démarrage. Tabby confirme qu’il est opérationnel quand il affiche le port d’écoute dans les logs.",{"title":88,"body":89},"Configurer le reverse proxy et activer l’authentification","Pointez un sous-domaine vers `localhost:8080` via Caddy ou Nginx Proxy Manager avec TLS. Dans l’interface d’administration Tabby, activez la gestion des utilisateurs, créez le compte administrateur et générez des tokens d’accès individuels pour chaque développeur.",{"title":91,"body":92},"Installer le plugin VS Code et renseigner le token","Dans VS Code, installez l’extension **Tabby** disponible sur le Marketplace. Renseignez l’URL de votre serveur (ex. `https:\u002F\u002Ftabby.votre-domaine.com`) et le token personnel dans les paramètres de l’extension. La complétion inline s’active immédiatement dans tous les fichiers ouverts.",{"type":34,"title":94,"body":95},"LiteLLM comme passerelle multi-modèles","Si vous orchestrez plusieurs sources de modèles — Ollama sur un VPS pour le travail courant, une API externe pour les tâches complexes — LiteLLM unifie tout derrière un point d’entrée unique compatible OpenAI. Continue.dev ou tout client qui parle OpenAI pointe vers LiteLLM, qui route vers le bon backend selon des règles de priorité ou de budget.\n\nVous définissez des plafonds de dépense par clé API, des fallbacks automatiques en cas d’erreur d’un fournisseur, et une rotation entre modèles depuis un fichier de configuration central. Le template VPS LiteLLM du catalogue ServOrbit déploie le proxy et sa base PostgreSQL en une commande. C’est la couche indiquée si vous voulez garder la possibilité de basculer vers un modèle cloud sans changer la configuration de votre éditeur.",{"type":97,"body":98},"tip","N’exposez jamais Ollama directement sur Internet. Fermez le port `11434` avec `ufw deny 11434` et laissez uniquement le reverse proxy s’y connecter en local. Si plusieurs personnes partagent le même serveur Ollama, LiteLLM ajoute une couche de gestion de clés API individuelles par-dessus, sans modifier la configuration Ollama : chaque développeur a son token LiteLLM, LiteLLM parle à Ollama en interne.",{"type":34,"title":100,"body":101},"Dépannage","**Timeout Ollama au premier appel.** Vérifiez que le conteneur tourne (`docker ps`) et que le modèle est chargé (`docker exec ollama ollama list`). Un modèle 7B peut prendre 30 à 60 secondes pour se charger en mémoire au premier appel après un redémarrage du conteneur.\n\n**Modèle trop lourd pour la RAM disponible.** Surveillez `docker stats` pour suivre l’usage mémoire. Passez à une quantification plus légère (`Q3_K_M` ou `Q2_K`) ou à un modèle plus compact (1.5B ou 3B).\n\n**Continue.dev ne trouve pas l’API.** Vérifiez que `apiBase` dans `config.json` pointe vers l’URL HTTPS de votre reverse proxy et non vers `localhost:11434`. Testez avec `curl -I https:\u002F\u002Follama.votre-domaine.com` pour confirmer que le certificat TLS est valide et que le serveur répond.\n\n**Latence élevée en CPU uniquement.** Sur un modèle 7B en Q4 sans GPU, comptez 5 à 15 tokens par seconde selon le nombre de vCPU. Réduisez le contexte envoyé à Continue.dev en limitant le nombre de fichiers ouverts inclus dans l’index (paramètre `contextLength`).",{"type":34,"title":103,"body":104},"Ce que ça change concrètement","Le passage de Copilot aux AI Credits a rendu la facturation variable au moment où les sessions agentiques en consomment le plus. Un VPS avec Ollama répond avec un coût mensuel fixe, un contrôle total sur les modèles utilisés, et des invites qui restent sur votre infrastructure.\n\nContinue.dev couvre le cas individuel en cinq minutes sans changer d’IDE. Tabby couvre le cas équipe avec authentification par token et administration centralisée. LiteLLM s’intercale si vous orchestrez plusieurs sources de modèles depuis un point unique. Ces trois outils sont complémentaires, pas concurrents : le choix dépend du nombre de développeurs, du besoin d’audit et de la diversité des modèles à orchestrer.","Moteur d’inférence prêt sur VPS, à coût fixe","Le template Ollama du catalogue ServOrbit déploie le moteur d’inférence sur un VPS Cloud en une commande. API compatible OpenAI, port exposé uniquement en local, volume persistant pour les modèles. Ajoutez Continue.dev dans VS Code et votre assistant de code tourne sur votre propre infrastructure.","Activer Ollama sur VPS","\u002Fmarketplace\u002Fia\u002Follama",[110,125,146],{"id":111,"slug":112,"slugs":113,"title":116,"excerpt":117,"readTime":118,"views":15,"isPinned":16,"publishedAt":119,"category":120,"categories":121,"featuredImage":26,"bgImage":27,"posterImage":123,"relatedSolution":124},11,"heberger-ollama-vps",{"fr":112,"en":114,"ar":115},"how-to-host-ollama-on-a-vps","كيفية-استضافة-ollama-على-خادم-vps","Héberger Ollama sur un VPS : guide opérationnel avancé","Configuration avancée d'Ollama sur VPS : gestion des modèles, reverse proxy nginx, sécurité API, quantisation Q4_K_M\u002FQ8, CVE-2026-45672 Open WebUI et couplage sécurisé.",10,"2026-06-09T00:00:00+00:00",{"id":19,"name":20,"slug":21,"color":22,"icon":23},[122],{"id":19,"name":20,"slug":21,"color":22,"icon":23},"\u002Fblog\u002Fcovers\u002Fheberger-ollama-vps-poster.svg",{"categorySlug":23,"appSlug":30},{"id":126,"slug":127,"slugs":128,"title":131,"excerpt":132,"readTime":133,"views":15,"isPinned":16,"publishedAt":134,"category":135,"categories":141,"featuredImage":26,"bgImage":27,"posterImage":143,"relatedSolution":144},156,"self-host-litellm-vps",{"fr":127,"en":129,"ar":130},"self-host-litellm-on-a-vps-your-private-llm-api-gateway","استضف-litellm-ذاتيا-على-vps-بوابة-api-خاصة-لنماذج-llm","Héberger LiteLLM sur un VPS : votre passerelle d'API LLM privée","Déployez LiteLLM sur un VPS ServOrbit : passerelle d'API compatible OpenAI vers Ollama, Anthropic, Azure et 100+ LLM, avec suivi des dépenses et limites par clé.",4,"2026-01-21T00:00:00+00:00",{"id":136,"name":137,"slug":138,"color":139,"icon":140},7,"Self-hosting","self-hosting","bg-indigo-500\u002F10 text-indigo-400","cloud",[142],{"id":136,"name":137,"slug":138,"color":139,"icon":140},"\u002Fblog\u002Fcovers\u002Fself-host-litellm-vps-poster.svg",{"categorySlug":23,"appSlug":145},"litellm",{"id":147,"slug":148,"slugs":149,"title":152,"excerpt":153,"readTime":154,"views":15,"isPinned":16,"publishedAt":155,"category":156,"categories":157,"featuredImage":26,"bgImage":27,"posterImage":159,"relatedSolution":26},214,"mcp-serveur-ia-auto-heberge-vps",{"fr":148,"en":150,"ar":151},"how-to-deploy-an-mcp-server-on-a-vps","كيفية-نشر-خادم-mcp-على-vps","Déployer un serveur MCP sur VPS","Le protocole MCP 2026-07-28 est devenu le standard universel des agents IA. Voici comment héberger votre propre serveur MCP sur un VPS en quelques étapes.",5,"2026-08-03T00:00:00+00:00",{"id":19,"name":20,"slug":21,"color":22,"icon":23},[158],{"id":19,"name":20,"slug":21,"color":22,"icon":23},"\u002Fblog\u002Fcovers\u002Fmcp-serveur-ia-auto-heberge-vps-poster.svg",1787580971964]