دليل النشر

كيفية استضافة GPT4All على خادم VPS

انشر على VPS Cloud →

الذكاء الاصطناعي7 دقيقة قراءة

كيفية استضافة GPT4All على خادم VPS

يتيح GPT4All تشغيل نماذج لغوية كبيرة بالكامل على وحدة المعالجة المركزية CPU، دون الاعتماد على سحابة أي مزوّد. مثبَّتًا على خادم VPS، يعرِض واجهة API متوافقة مع OpenAI يمكن لتطبيقاتك استعلامها محليًا. إليك كيفية نشره في وضع الخادم، خلف وكيل عكسي مع SSL ومفتاح API.

لماذا تستضيف GPT4All ذاتيًا على خادم VPS

تكمن قوة GPT4All في تشغيل النماذج المُكمَّمة (بصيغة GGUF) بكفاءة على وحدة المعالجة المركزية CPU، دون بطاقة رسومات. وهذا بالضبط ما يلزم خادم VPS قياسيًا. باستضافته بنفسك، تحصل على مساعد ذكاء اصطناعي خاص لا يخرج أي طلب منه من بنيتك التحتية: لا موجِّهاتك ولا مستنداتك الداخلية تُرسَل إلى طرف ثالث. ينشر وضع الخادم في GPT4All واجهة API تحاكي واجهة OpenAI (/v1/chat/completions)، ما يتيح إعادة استخدام أي SDK قائم بمجرد تغيير عنوان URL الأساسي. تدير كتالوج نماذجك محليًا وتختار النموذج الذي يتّسع في ذاكرة RAM الخاصة بخادم VPS لديك.

الفوائد الملموسة للاستضافة الذاتية

  • يعمل على وحدة معالجة مركزية CPU خالصة: لا حاجة إلى وحدة GPU، مثالي لخادم VPS اعتيادي.
  • واجهة API متوافقة مع OpenAI: هجرة كود بسيطة (تغيير عنوان URL الأساسي).
  • خصوصية الموجِّهات والمستندات: يبقى كل شيء على خادم VPS.
  • لا اشتراك ولا تكلفة بالرمز (token): سعر VPS ثابت.
  • اختيار النموذج وفق ذاكرة RAM المتاحة (من 3 غيغابايت إلى 13 غيغابايت حسب التكميم).
  • التوفّر دون اتصال: يجيب المساعد حتى دون وصول إلى واجهات API خارجية.

المتطلبات العتادية والبرمجية

GPT4All مُقتصِد عمدًا، لكنه يظل معتمدًا على ذاكرة RAM. يتطلب نموذج 7B مُكمَّم بـ Q4 (مثل Mistral 7B Instruct) نحو 8 غيغابايت من ذاكرة RAM؛ أما نموذج 3B خفيف فيكتفي بـ 4 إلى 6 غيغابايت. للاستخدام المريح، استهدف خادم VPS بـ 4 أنوية vCPU و8 إلى 16 غيغابايت من ذاكرة RAM — كلما زادت الأنوية، زادت سرعة التوليد. احسب 4 إلى 8 غيغابايت من القرص لكل نموذج GGUF. أما برمجيًا: فيلزم Ubuntu 22.04 وDocker (أو ثنائيات Python الخاصة بـ gpt4all)، وcurl للاختبارات، ونطاق فرعي من نوع llm.mydomain.com. ولا يلزم أي تعريف لوحدة GPU.

النشر خطوة بخطوة

01

تثبيت بيئة التشغيل

عبر SSH، أنشئ بيئة Python وثبّت الحزمة الرسمية: pip install gpt4all. يمكنك أيضًا وضع المجموعة في حاوية ضمن ملف Dockerfile مبني على python:3.11-slim لعزل التبعيات.

02

تنزيل نموذج GGUF

ضع نموذجًا متوافقًا (مثل mistral-7b-instruct-v0.1.Q4_0.gguf) في مجلد ./models. يستطيع GPT4All تنزيله تلقائيًا عند أول تشغيل، لكن الإيداع اليدوي يتجنّب مفاجآت عرض النطاق الترددي.

03

تشغيل خادم واجهة API

شغّل GPT4All في وضع الخادم بحيث تعرِض نقطة النهاية المتوافقة مع OpenAI على المنفذ 4891. أحِط العملية بخدمة systemd أو حاوية restart: unless-stopped كي تعيد التشغيل من تلقاء نفسها.

04

اختبار الاستدلال

تحقّق محليًا: curl http://localhost:4891/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"mistral-7b-instruct","messages":[{"role":"user","content":"Bonjour"}]}'. يجب أن تصل الإجابة في غضون بضع ثوانٍ.

05

التأمين والتعريض

ضع Nginx أو Caddy أمام المنفذ 4891، وأضف تحقّقًا من مفتاح API (ترويسة Authorization) وفعّل SSL من Let's Encrypt لـ llm.mydomain.com. لا تعرِض المنفذ الخام على الإنترنت أبدًا دون مصادقة.

06

ربط تطبيقاتك

في أي SDK خاص بـ OpenAI، وجّه base_url إلى https://llm.mydomain.com/v1 واستخدم مفتاحك. تعمل استدعاءاتك القائمة دون إعادة كتابة منطق العمل.

على خادم VPS متعدد الأنوية، حدّد صراحةً عدد الخيوط (n_threads مساوٍ لعدد أنوية vCPU) لاستغلال وحدة المعالجة المركزية CPU بالكامل: تتأثر سرعة التوليد بذلك مباشرةً. وإذا بقي زمن الاستجابة مرتفعًا جدًا، فانزل درجة في التكميم (Q4 بدل Q5) أو اختر نموذج 3B: تنخفض الجودة قليلًا لمهام التصنيف أو الاستخراج أو الإجابة القصيرة، مع تحرير ذاكرة RAM لخدمة عدة طلبات على التوازي.

شغّل نموذج LLM الخاص بك على خادم VPS Cloud من ServOrbit

انشر GPT4All وواجهته المتوافقة مع OpenAI على خادم VPS Cloud مُحسَّن لوحدة المعالجة المركزية CPU. مساعد ذكاء اصطناعي محلي وخاص ودون تكلفة بالرمز (token)، متاح باستمرار.

بحاجة إلى مساعدة؟

تصفّح مركز المساعدة والأسئلة الشائعة، أو راسل فريقنا — الدعم بـ العربية والفرنسية والإنجليزية.