إنتقل إلى المحتوى الرئيسي

متطلبات الأجهزة

واجهة المحادثة المعتادة في Libre WebUI خفيفة. تأتي معظم متطلبات الموارد من نماذج Ollama المحلية؛ وتضيف مهام Work المدعومة بحاويات ميزانية منفصلة لـ CPU والذاكرة والعمليات والصور وتخزين المشاريع.

مرجع سريع

الأجهزةالنماذج المحلية العمليةملاحظات
8 GB من RAM، CPU فقط1B-4B مكمّاةمناسب للاختبار والمحادثة الخفيفة
16 GB من RAM، CPU فقط4B-8B مكمّاةقابل للاستخدام، أبطأ من GPU
8 GB من VRAM4B-8B مكمّاةإعداد محلي يومي جيد
12-16 GB من VRAM8B-14B مكمّاةنطاق قوي لمحطات العمل
24 GB من VRAM14B-32B مكمّاةاستخدام محلي متقدم
48 GB+ من VRAM أو ذاكرة موحدة كبيرة32B-70B مكمّاةتجربة النماذج الكبيرة

تعتمد السرعة الفعلية على بنية النموذج والكمّ وطول السياق وبرامج تشغيل GPU وما يعمل بالتوازي.

نماذج جيدة للبدء

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

استخدم nomic-embed-text لتضمينات المستندات، لا كنموذج محادثة.

VRAM مقابل RAM

تُعد VRAM العامل الأهم في سرعة النموذج المحلي. إذا اتسع النموذج داخل VRAM كانت الردود أسرع كثيرًا. وإذا امتد إلى RAM النظام، فقد يظل يعمل لكنه سيكون أبطأ.

تهم RAM النظام في الاستدلال على CPU وتفريغ GPU ونوافذ السياق الطويلة وتشغيل بقية التطبيق.

Apple Silicon

يستخدم Apple Silicon ذاكرة موحدة، فتأتي ذاكرة النموذج من المخزون نفسه الذي يستخدمه نظام التشغيل والتطبيقات. تستطيع الأجهزة ذات الذاكرة الموحدة الأكبر تشغيل نماذج مكمّاة أكبر مما قد يوحي به رقم VRAM في نظام ببطاقة GPU منفصلة.

اترك ذاكرة حرة كافية للمتصفح والخادم الخلفي ونظام التشغيل.

NVIDIA

تتمتع وحدات GPU من NVIDIA عمومًا بأفضل توافق للاستدلال المحلي عبر CUDA. استخدم برامج تشغيل حديثة وتحقق من وصول Docker إلى GPU عند تشغيل Ollama في حاويات.

AMD وIntel

يعتمد دعم AMD وIntel على Ollama وبرامج التشغيل المتاحة لمنصتك. يظل الاستدلال على CPU متاحًا عند غياب تسريع GPU.

خفض استخدام الذاكرة

  • استخدم نماذج أصغر.
  • استخدم كمّ Q4 بدل Q8.
  • اخفض طول السياق.
  • ألغِ تحميل النماذج التي لا تستخدمها.
  • افصل اختيار نموذج تضمينات المستندات عن نموذج المحادثة.

سعة بيئة Work

تضيف Work موارد حاويات إلى ما تستخدمه WebUI وعملية النموذج. تحصل كل حاوية مهمة نشطة افتراضيًا على:

  • 2 GB من الذاكرة؛
  • 2 من CPU؛ و
  • 256 عملية.

يسمح الخادم الخلفي افتراضيًا بمهمتين نشطتين مدعومتين بحاويات على مستوى المثيل وبمهمة واحدة لكل مسؤول. هذه حدود لا حجوزات، لكن ينبغي للمشغّلين احتساب WebUI والمتصفح وDocker وOllama وحاوية المهمة معًا. وعلى Apple Silicon، تتنافس كلها في النهاية على مخزون الذاكرة الموحدة نفسه.

قد يمنع استخدام Ollama Cloud أو مكوّن نموذج بعيد مضبوط تحميل نموذج كبير في RAM أو VRAM المحلية. لكنه لا يلغي شرط Docker أو الموارد التي تحتاجها حاوية Work.

تملك كل مهمة Work أيضًا وحدة Docker مسماة للملفات المولّدة والاعتماديات المحلية. لا تملك الوحدات حاليًا حصصًا للقرص لكل مهمة، لذلك قد تستنفد عمليات تثبيت الحزم أو المشاريع المولّدة مساحة Docker. راقب جذر بيانات Docker واضبط حدودًا على المضيف حيث تتاح، وانسخ وحدات المهام احتياطيًا بمعزل عن قاعدة بيانات Libre WebUI.

لا تضبط إعدادات WORK_MEMORY_LIMIT وWORK_CPU_LIMIT وWORK_PIDS_LIMIT وWORK_MAX_ACTIVE_RUNTIMES_* إلا بعد قياس مضيف الخادم الخلفي. راجع مرجع متغيرات البيئة للقيم الافتراضية.

مستندات ذات صلة