بناء واستضافة وتشغيل حلول الذكاء الاصطناعي.

شعار LocalAI

LocalAI

شغّل نماذج LLM مفتوحة المصدر على المعالج (CPU) — دون الحاجة إلى GPU. واجهة متوافقة مع OpenAI، أكثر من 200 نموذج، مستضافة ذاتيًا بأمر واحد.

2 GB (يُنصح بـ 4 GB للنماذج 7B فأكثر) ذاكرة عشوائية 2 vCPU (4 vCPU recommended) المنفذ 8080 متاح

المنظومة التقنية

DockerGollama.cpp
الحد الأدنى من RAM2 GB (يُنصح بـ 4 GB للنماذج 7B فأكثر)
الحد الأدنى من CPU2 vCPU (4 vCPU recommended)
المنفذ الافتراضي8080
أنظمة التشغيل المتوافقةتوزيعات Linux حسب اختيارك

LocalAI (رخصة MIT، نحو 47 ألف نجمة على GitHub) هو بديل مجاني ومفتوح المصدر لواجهة OpenAI البرمجية. يعمل على عتاد استهلاكي دون GPU — إذ يمكن لأي خادم VPS بذاكرة 2 GB أن يخدم نماذج Llama 3 وMistral وPhi-3 وQwen وأكثر من 200 نموذج آخر عبر واجهة REST متوافقة مع OpenAI. تعمل شيفرتك الحالية التي تستدعي `openai.ChatCompletion.create()` دون أي تعديل: غيّر عنوان URL الأساسي إلى خادمك VPS فتُوجَّه جميع نداءات الواجهة البرمجية محليًا، بتكلفة صفرية لكل رمز (token) وخصوصية تامة للبيانات.

بعد نشره على خادم VPS من ServOrbit، يصبح LocalAI الواجهة الخلفية الخاصة بك لنماذج LLM: نقطة نهاية تستدعيها تطبيقات فريقك وخطوط أنابيب RAG وأطر الوكلاء بدلًا من OpenAI — دون أي اعتماد على السحابة، ودون حدود استخدام، ودون خروج أي بيانات من بنيتك التحتية. يدعم LocalAI توليد النصوص واستدعاء الدوال وتوليد الصور (Stable Diffusion) وتحويل الكلام إلى نص (Whisper) وتضمينات النصوص (embeddings) — كل ذلك من حاوية واحدة.

الميزات الرئيسية

واجهة REST متوافقة مع OpenAI — بديل جاهز للاستبدال لـ OpenAI، يعمل مع كل حزم تطوير LangChain/LlamaIndex/LiteLLM دون تغيير.
استدلال على المعالج فقط — يعمل على أي خادم VPS دون GPU باستخدام llama.cpp؛ مع مسارات SIMD مُحسَّنة لمعالجات Intel وARM.
دعم أكثر من 200 نموذج — Llama 3 وMistral وPhi-3 وQwen 2.5 وDeepSeek وGemma 2 وFalcon وأي نموذج بصيغة GGUF.
متعدد الوسائط: توليد النصوص واستدعاء الدوال/الأدوات والتضمينات (embeddings) وتوليد الصور (Stable Diffusion) وتحويل الكلام إلى نص (Whisper).
اجلب النماذج بالاسم — `curl http://localhost:8080/models/apply -d '{"id":"llama-3.2-3b-instruct:q4_0"}'` يُنزّل أي نموذج مدعوم ويُفعّله.
رخصة MIT — قابل للتدقيق بالكامل، دون قياس عن بُعد (telemetry)، وقادر على العمل في بيئة معزولة تمامًا (air-gap)؛ الإصدار v4.6.2 (الصادر في 2026-07-06) يضيف وضع العنقود الموزّع والتوجيه المدرك للتخزين المؤقت بالبادئة (prefix-cache).
قابل للدمج مع LiteLLM وOpen WebUI — يوفّر LocalAI طبقة الاستدلال؛ ويضيف LiteLLM التوجيه متعدد المزودين؛ ويضيف Open WebUI واجهة المحادثة.

متى تستخدم هذا الحل؟

1

واجهة LLM خلفية خاصة لتطبيقاتك

استبدل نداءات واجهة OpenAI البرمجية بنقطة نهاية LocalAI على خادمك VPS. يُرسل تطبيقك SaaS أو أداتك الداخلية أو خط أنابيب RAG الطلبات إلى `http://your-vps:8080/v1/chat/completions` — بنفس صيغة JSON ونفس حزمة التطوير (SDK) وبتكلفة صفرية لكل رمز. مثالي للاستخدامات كثيفة الحجم حيث يصبح التسعير لكل رمز عائقًا.

2

استدلال معزول تمامًا للبيانات الحساسة

بالنسبة للتطبيقات القانونية أو الطبية أو المالية التي لا يمكن أن تغادر بياناتها بنيتك التحتية، يعمل LocalAI دون اتصال بالكامل بمجرد تنزيل النموذج. لا يصل أي طلب إلى واجهة برمجية خارجية. تُخزَّن ملفات نماذج GGUF في وحدة تخزين Docker على قرصك الخاص.

3

التضمينات والبحث الدلالي دون مفتاح واجهة برمجية

شغّل نماذج التضمين (nomic-embed-text وmxbai-embed-large) محليًا إلى جانب Qdrant على الخادم VPS نفسه لبناء خط أنابيب كامل للبحث الدلالي أو RAG. دون تكلفة واجهة تضمين OpenAI، ودون خروج أي بيانات من خادمك، ودون حدود على المعدل.

نشر LocalAI على خادم VPS الخاص بك

دليل محسّن لخوادم VPS Cloud من ServOrbit.

01

أنشئ الخادم VPS

اطلب خادم VPS من ServOrbit بذاكرة 2 GB على الأقل ونظام Ubuntu 22.04 أو 24.04. للاستخدام المريح متعدد المستخدمين أو للنماذج الأكبر (7B فأكثر)، يُنصح بذاكرة 4 GB. عدد أنوية المعالج مهم لسرعة الاستدلال: يقلّل 4 vCPU زمن استجابة التوليد بوضوح على النماذج من فئة 3–7B.

02

انشر LocalAI

اتصل عبر SSH ونفّذ: docker run -d --restart=always -p 8080:8080 -v local-ai:/build/models --name localai localai/localai:latest. تُشغّل الصورة (نحو 900 MB) خادم واجهة برمجية متوافقًا مع OpenAI. يؤدي أول طلب لنموذج ما إلى تنزيله تلقائيًا إلى وحدة التخزين الدائمة.

03

اجلب نموذجًا

نزّل أول نموذج بنداء واحد للواجهة البرمجية: curl http://localhost:8080/models/apply -H 'Content-Type: application/json' -d '{"id":"llama-3.2-3b-instruct:q4_0"}'. يجلب LocalAI ملف GGUF ويسجّله. يتّسع تكميم 3B Q4 في ذاكرة 2 GB؛ بينما يحتاج 7B Q4 إلى نحو 4 GB.

04

أجرِ أول نداء للواجهة البرمجية

اختبر الواجهة البرمجية: curl http://localhost:8080/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"llama-3.2-3b-instruct:q4_0","messages":[{"role":"user","content":"Hello!"}]}'. تكون الاستجابة مطابقة تمامًا لاستجابة OpenAI — غيّر عنوان URL الأساسي في شيفرتك الحالية فيعمل كل شيء.

05

وجّه تطبيقاتك إلى LocalAI

في أي حزمة تطوير OpenAI، اضبط base_url='http://your-vps-ip:8080/v1' وapi_key='not-needed'. في LangChain: ChatOpenAI(base_url=..., api_key='x'). في LiteLLM: أضِف البادئة localai/. في Open WebUI: اضبط اتصال OpenAI بعنوان URL الخاص بخادمك VPS. لا تحتاج شيفرتك الحالية إلى أي تغيير آخر.

06

اختياري: احمِ نقطة النهاية

يكون LocalAI مفتوحًا افتراضيًا. لإضافة المصادقة، اضبط متغيّر البيئة LOCALAI_API_KEY=your-secret عند تشغيل الحاوية. للحصول على HTTPS، ضع Caddy في المقدمة: ai.yourdomain.com { reverse_proxy localhost:8080 } — يُصدر Caddy شهادة Let's Encrypt تلقائيًا. قيّد المنفذ 8080 على عنوان IP الخاص بمكتبك باستخدام ufw عند الحاجة.

الأسئلة الشائعة

LocalAI هو خادم مجاني ومفتوح المصدر (رخصة MIT) يشغّل النماذج اللغوية الكبيرة محليًا على أي معالج (CPU). يُتيح واجهة REST متوافقة مع OpenAI، لذا تعمل شيفرتك الحالية دون تعديل — ما عليك سوى تغيير عنوان URL الأساسي للواجهة البرمجية إلى خادمك.

بناء واستضافة وتشغيل حلول الذكاء الاصطناعي.

فعّل LocalAI على بنيتك التحتية.

خادم VPS Cloud مخصص — عنوان IPv4 مضمّن، مركز بيانات أوروبي، والدعم مضمّن. لا تغادر بياناتك خادمك أبدًا.

الإعداد الموصى به: 2 GB (يُنصح بـ 4 GB للنماذج 7B فأكثر) RAM · 2 vCPU (4 vCPU recommended)

بحاجة إلى مساعدة؟

تصفّح مركز المساعدة والأسئلة الشائعة، أو راسل فريقنا — الدعم بـ العربية والفرنسية والإنجليزية.