मुख्य कंटेंट तक स्किप करें

हार्डवेयर आवश्यकताएँ

Libre WebUI का सामान्य Chat इंटरफ़ेस हल्का है। अधिकतर संसाधन स्थानीय Ollama मॉडल लेते हैं; Work कार्य अलग CPU, स्मृति, प्रक्रिया, इमेज और परियोजना स्टोरेज बजट जोड़ते हैं।

त्वरित तालिका

हार्डवेयरव्यावहारिक स्थानीय मॉडलटिप्पणी
8 GB RAM, केवल CPUक्वांटाइज़ 1B-4Bपरीक्षण और हल्का चैट
16 GB RAM, केवल CPUक्वांटाइज़ 4B-8Bउपयोगी, GPU से धीमा
8 GB VRAMक्वांटाइज़ 4B-8Bअच्छा दैनिक सेटअप
12-16 GB VRAMक्वांटाइज़ 8B-14Bशक्तिशाली वर्कस्टेशन
24 GB VRAMक्वांटाइज़ 14B-32Bउन्नत स्थानीय उपयोग
48 GB+ VRAM या बड़ी संयुक्त स्मृतिक्वांटाइज़ 32B-70Bबड़े मॉडल प्रयोग

वास्तविक गति मॉडल वास्तुकला, क्वांटाइज़ेशन, संदर्भ लंबाई, GPU ड्राइवर और अन्य प्रक्रियाओं पर निर्भर है।

अच्छे प्रारंभिक मॉडल

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

nomic-embed-text को दस्तावेज़ एम्बेडिंग के लिए उपयोग करें, चैट मॉडल के लिए नहीं।

VRAM और RAM

VRAM स्थानीय मॉडल गति का मुख्य कारक है। मॉडल VRAM में समाए तो उत्तर बहुत तेज़ होते हैं। सिस्टम RAM में जाए तो चल सकता है, पर धीमा होगा।

सिस्टम RAM CPU अनुमान, GPU ऑफ़लोड, लंबे संदर्भ और शेष ऐप के लिए महत्वपूर्ण है।

Apple Silicon

Apple Silicon संयुक्त स्मृति उपयोग करता है, इसलिए मॉडल OS और ऐप के साथ एक ही पूल साझा करता है। अधिक संयुक्त स्मृति वाले कंप्यूटर अलग GPU के VRAM आँकड़े से बड़े क्वांटाइज़ मॉडल चला सकते हैं।

ब्राउज़र, बैकएंड और OS के लिए पर्याप्त स्मृति रखें।

NVIDIA

NVIDIA GPU सामान्यतः CUDA के माध्यम से सर्वोत्तम स्थानीय अनुमान संगतता देते हैं। आधुनिक ड्राइवर उपयोग करें और कंटेनर Ollama में Docker GPU पहुँच जाँचें।

AMD और Intel

समर्थन Ollama और प्लेटफ़ॉर्म ड्राइवर पर निर्भर है। GPU त्वरण न हो तो CPU उपलब्ध है।

स्मृति उपयोग घटाना

  • छोटे मॉडल उपयोग करें।
  • Q8 के बजाय Q4 क्वांटाइज़ेशन उपयोग करें।
  • संदर्भ लंबाई घटाएँ।
  • अनुपयोगी मॉडल अनलोड करें।
  • एम्बेडिंग मॉडल को चैट मॉडल से अलग रखें।

Work रनटाइम क्षमता

Work, WebUI और मॉडल के अतिरिक्त कंटेनर संसाधन जोड़ता है। हर सक्रिय कार्य कंटेनर डिफ़ॉल्ट रूप से:

  • 2 GB स्मृति;
  • 2 CPU; और
  • 256 प्रक्रियाएँ पाता है।

बैकएंड डिफ़ॉल्ट रूप से पूरे इंस्टेंस में दो और व्यवस्थापक पर एक सक्रिय कार्य देता है। ये सीमा हैं, आरक्षण नहीं; ऑपरेटर को WebUI, ब्राउज़र, Docker, Ollama और कार्य कंटेनर साथ गिनने चाहिए। Apple Silicon पर सभी संयुक्त स्मृति साझा करते हैं।

Ollama Cloud या दूरस्थ प्लगइन बड़े मॉडल को स्थानीय RAM/VRAM में लोड होने से बचा सकता है। Docker आवश्यकता और Work संसाधन नहीं हटते।

हर Work कार्य की फ़ाइल और निर्भरता के लिए नामित Docker वॉल्यूम है। प्रति-कार्य डिस्क कोटा नहीं है; पैकेज या परियोजना स्टोरेज भर सकते हैं। Docker डेटा जड़ देखें, होस्ट सीमा लगाएँ और कार्य वॉल्यूम को Libre WebUI डेटाबेस से अलग बैकअप करें।

WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT और WORK_MAX_ACTIVE_RUNTIMES_* को होस्ट मापने के बाद ही बदलें। डिफ़ॉल्ट पर्यावरण चर संदर्भ में हैं।

संबंधित दस्तावेज़