لماذا استضافة نموذج لغوي على VPS خاص بك في 2026
يوفّر تشغيل نموذج لغوي على خادمك الخاص أربع مزايا ملموسة. أولاً الخصوصية: بياناتك لا تغادر الخادم أبداً، مما يجعل الإعداد متوافقاً بشكل طبيعي مع لائحة GDPR دون اتفاقيات معالجة بيانات معقدة. ثانياً التكلفة: لا رسوم على رموز API، مجرد فاتورة VPS ثابتة وقابلة للتنبؤ. ثالثاً التوافر المضمون: لا اعتماد على خدمة طرف ثالث، ولا حصص، ولا انقطاعات خارجية. وأخيراً التخصيص: أنت تختار النموذج ومستوى الضغط والمعاملات، ويمكنك ضبط النموذج أو التبديل بأمر واحد.
ما الذي يتيح لك Ollama فعله
- الاستدلال المحلي — Llama 3.2 وQwen2.5 وPhi-3-mini وأكثر من 150 نموذج GGUF جاهزاً للاستخدام
- واجهة برمجة متوافقة مع OpenAI — وصّل n8n أو Open WebUI أو أي عميل موجود دون تغيير سطر واحد من الكود
- تعدد الوسائط — LLaVA وGemma3 لتحليل الصور ووصفها محلياً
- وكيل تفاعلي مدمج — v0.32.0: تحوّل طرفية Ollama إلى وكيل قادر على البرمجة والبحث وتفويض المهام الفرعية
- أوضاع CPU وGPU — AVX-512 على معالجات EPYC أو Xeon: 8-12 رمز في الثانية بدون بطاقة رسومات على VPS بذاكرة 8 جيجابايت
المتطلبات الواقعية لتشغيل نموذج لغوي على VPS
لتشغيل Phi-3-mini أو Llama 3.2 3B بضغط Q4_K_M، تحتاج كحد أدنى إلى 4 وحدات معالجة افتراضية و8 جيجابايت من الذاكرة العشوائية و20 جيجابايت من التخزين NVMe. لنموذج Qwen2.5-7B، ارفع الذاكرة إلى 16 جيجابايت. نظام التشغيل الموصى به هو Ubuntu 24.04 LTS الذي يتضمن جميع الاعتماديات اللازمة. لا تحتاج إلى GPU للنماذج من 3B إلى 7B بضغط Q4_K_M: مجموعات تعليمات AVX-512 الموجودة في معالجات EPYC وXeon الحديثة كافية. يجب أن يستمع المنفذ 11434 فقط على المضيف المحلي، وأي وصول عن بُعد يمر عبر بروكسي عكسي.
نشر Ollama على VPS في 5 خطوات
تثبيت Ollama
اتصل بـ SSH بخادم VPS وشغّل السكريبت الرسمي: curl -fsSL https://ollama.com/install.sh | sh. تبدأ خدمة systemd الخاصة بـ ollama تلقائيًا وتستمع على 127.0.0.1:11434.
تنزيل أول نموذج
اسحب Phi-3-mini (2.2 جيجابايت، مثالي للبداية): ollama pull phi3:mini. لنموذج أكثر قدرة، استخدم ollama pull llama3.2:3b أو ollama pull qwen2.5:7b حسب الذاكرة المتاحة لديك.
الاختبار من سطر الأوامر
أطلق جلسة تفاعلية: ollama run phi3:mini. اكتب سؤالك واضغط Enter. للاستعلام عبر واجهة REST: curl http://localhost:11434/api/generate -d '{"model":"phi3:mini","prompt":"مرحباً"}'.
كشف واجهة API عبر HTTPS مع Nginx
ثبّت Nginx وCertbot، وأنشئ vhost لـ your-domain.com مع proxy_pass http://127.0.0.1:11434;، واحصل على شهادة Let's Encrypt بالأمر certbot --nginx -d your-domain.com، ثم أضف مصادقة HTTP Basic أو رمز Bearer لحماية الوصول.
ربط Open WebUI
انشر Open WebUI (راجع المقال المخصص) وأدخل عنوان URL لواجهة Ollama المؤمّنة. يظل ollama serve نشطاً كخدمة systemd، ولا تحتاج إلى أي أمر يدوي بعد إعادة التشغيل.
افتراضياً يستمع Ollama على OLLAMA_HOST=127.0.0.1، مما يحجب أي وصول خارجي مباشر. لا تغيّر هذا المتغير ليستمع على 0.0.0.0 بدون حماية: منفذ 11434 المفتوح على الإنترنت يمنح وصولاً كاملاً للنموذج والملفات المتاحة عبر واجهة API. استخدم دائماً بروكسي عكسي Nginx أو Caddy مع مصادقة (HTTP Basic أو رمز Bearer في ترويسة Authorization). تحقق بانتظام من أن المنفذ غير مكشوف: ss -tlnp | grep 11434.
المضي أبعد: بناء مجموعة أدوات ذكاء اصطناعي متكاملة
Ollama وحده محرك استدلال. لبناء مجموعة أدوات ذكاء اصطناعي متكاملة ومستقلة، اقرنه بـ Open WebUI (واجهة دردشة متعددة النماذج مع إدارة المحادثات والمستخدمين) وبـ Dify لتنسيق سير العمل المعقدة للذكاء الاصطناعي. أضف Gatus لمراقبة توافر كل خدمة مع تنبيهات تلقائية. أدلّتنا المخصصة تغطي كل عنصر: نشر Open WebUI على VPS، وإعداد Dify، وتهيئة Gatus للمراقبة. بدمج هذه الأدوات الثلاثة مع Ollama، تحصل على منصة ذكاء اصطناعي سيادية بدون اعتماد على أي مزوّد سحابي، بتكلفة شهرية ثابتة.