AI मॉडल के साथ काम करना
Libre WebUI स्थानीय Ollama और plugin-आधारित cloud models को एक workspace में चलाता है। Manager installed/running Ollama, Ollama Library, Hugging Face GGUF और Ollama Cloud दिखाता है।
पहला मॉडल चुनना
| मॉडल | उपयोग | अनुमानित संसाधन |
|---|---|---|
gemma4:12b | तेज़ chat | 16 GB RAM या 8 GB VRAM |
qwen3.8:27b | Chat, code, languages | 32 GB RAM या 16–24 GB VRAM |
gemma4:26b | Strong MoE chat | 24 GB RAM या 16 GB VRAM |
gemma4:31b | Quality dense chat | 32 GB RAM या 24 GB VRAM |
nomic-embed-text | Document embedding | छोटा local model |
30B, 70B और MoE अधिक memory माँगते हैं। छोटे model से शुरू करें।
मॉडल प्रबंधक
Settings → Models में नाम से Ollama pull करें, Library खोजें, models देखें/stop/delete करें, सभी installed Ollama models को एक ही operation में update करें, Hugging Face GGUF या Ollama Cloud लें। Cloud names के :cloud/-cloud suffix Libre normalize करता है।
Catalog और visibility
Settings → Defaults का Model Catalog local/provider models, badge और search दिखाता है। Catalog के ऊपर default model चुनने से तय होता है कि नए chats किस model से शुरू हों।
Administrator किसी model को star करके उसे catalog और default-model menu में सबसे ऊपर pin कर सकता है। कई stars में सबसे हाल में star किया गया पहले आता है; star हटाने पर model अपनी पुरानी जगह लौट जाता है।
Administrator model को दूसरों के selectors से छिपा सकता है; यह curation है, authorization boundary नहीं।
Local और cloud
| Mode | लाभ | Trade-off |
|---|---|---|
| Local Ollama | Privacy, offline, predictable cost | CPU/GPU/RAM |
| Ollama Cloud | Local limits के बिना परिचित flow | Network और cloud |
| Plugins | कई providers के managed models | API keys, price, provider privacy |
Default vision model
Settings → Defaults → Specialized Models → Vision Model में अलग model चुनें। Image वाला हर turn उसे जाता है; text turns session model पर रहते हैं।
Provider identity सहेजी जाती है। यदि वह खो जाए — जैसे model या provider अब उपलब्ध न हो — तो image वाला turn fail होता है। इसे ठीक करने के लिए model को Settings → Defaults → Specialized Models → Vision Model में फिर चुनें। साफ़ तौर पर fail होना जानबूझकर है; Libre WebUI चुपचाप कोई दूसरा provider नहीं लगाता।
Work के मॉडल
tools वाला chat model चाहिए: tool-capable Ollama, Ollama Cloud, या exact model और administrator credentials वाला active chat/completion plugin। Work OpenAI-compatible, Anthropic या Gemini adapter उपयोग करता है; fallback नहीं।
Remote provider Work system prompt, conversation, definitions और tool results पाता है। Volumes/credentials host पर रहते हैं, पर file content result में जा सकता है। एक run कई paid model calls कर सकता है; pricing, retention और training जाँचें।
Hardware
| System | व्यावहारिक range |
|---|---|
| CPU, 8–16 GB RAM | 1B–4B |
| 8 GB VRAM | 4B–8B quantized |
| 12–16 GB VRAM | 8B–14B quantized |
| 24 GB VRAM | 14B–32B quantized |
| 48 GB+ | 32B–70B quantized |
Q4 सामान्य default; Q8 बेहतर पर भारी।
कार्य के अनुसार
तेज़ chat: gemma4:12b; code: Qwen Coder/Codestral; reasoning: बड़े Qwen/Gemma; vision: LLaVA/Qwen VL; documents: nomic-embed-text; TTS: Qwen3-TTS/Kyutai।
Prompts और settings
Facts के लिए 0.1-0.3, सामान्य काम के लिए 0.5-0.7, creativity के लिए 0.8+ temperature। Context देखें और persistent settings के लिए personas उपयोग करें।
समस्या निवारण
Download error पर ollama list, disk और raw error देखें। Slow response पर छोटा model, ollama ps, कम context। Memory issue पर Q4, 8B, एक model और Docker GPU/Ollama access जाँचें।