मुख्य कंटेंट तक स्किप करें

AI मॉडल के साथ काम करना

Libre WebUI स्थानीय Ollama और plugin-आधारित cloud models को एक workspace में चलाता है। Manager installed/running Ollama, Ollama Library, Hugging Face GGUF और Ollama Cloud दिखाता है।

पहला मॉडल चुनना

मॉडलउपयोगअनुमानित संसाधन
gemma4:12bतेज़ chat16 GB RAM या 8 GB VRAM
qwen3.8:27bChat, code, languages32 GB RAM या 16–24 GB VRAM
gemma4:26bStrong MoE chat24 GB RAM या 16 GB VRAM
gemma4:31bQuality dense chat32 GB RAM या 24 GB VRAM
nomic-embed-textDocument embeddingछोटा local model

30B, 70B और MoE अधिक memory माँगते हैं। छोटे model से शुरू करें।

मॉडल प्रबंधक

Settings → Models में नाम से Ollama pull करें, Library खोजें, models देखें/stop/delete करें, सभी installed Ollama models को एक ही operation में update करें, Hugging Face GGUF या Ollama Cloud लें। Cloud names के :cloud/-cloud suffix Libre normalize करता है।

Catalog और visibility

Settings → Defaults का Model Catalog local/provider models, badge और search दिखाता है। Catalog के ऊपर default model चुनने से तय होता है कि नए chats किस model से शुरू हों।

Administrator किसी model को star करके उसे catalog और default-model menu में सबसे ऊपर pin कर सकता है। कई stars में सबसे हाल में star किया गया पहले आता है; star हटाने पर model अपनी पुरानी जगह लौट जाता है।

Administrator model को दूसरों के selectors से छिपा सकता है; यह curation है, authorization boundary नहीं।

Local और cloud

ModeलाभTrade-off
Local OllamaPrivacy, offline, predictable costCPU/GPU/RAM
Ollama CloudLocal limits के बिना परिचित flowNetwork और cloud
Pluginsकई providers के managed modelsAPI keys, price, provider privacy

Default vision model

Settings → Defaults → Specialized Models → Vision Model में अलग model चुनें। Image वाला हर turn उसे जाता है; text turns session model पर रहते हैं।

Provider identity सहेजी जाती है। यदि वह खो जाए — जैसे model या provider अब उपलब्ध न हो — तो image वाला turn fail होता है। इसे ठीक करने के लिए model को Settings → Defaults → Specialized Models → Vision Model में फिर चुनें। साफ़ तौर पर fail होना जानबूझकर है; Libre WebUI चुपचाप कोई दूसरा provider नहीं लगाता।

Work के मॉडल

tools वाला chat model चाहिए: tool-capable Ollama, Ollama Cloud, या exact model और administrator credentials वाला active chat/completion plugin। Work OpenAI-compatible, Anthropic या Gemini adapter उपयोग करता है; fallback नहीं।

Remote provider Work system prompt, conversation, definitions और tool results पाता है। Volumes/credentials host पर रहते हैं, पर file content result में जा सकता है। एक run कई paid model calls कर सकता है; pricing, retention और training जाँचें।

Hardware

Systemव्यावहारिक range
CPU, 8–16 GB RAM1B–4B
8 GB VRAM4B–8B quantized
12–16 GB VRAM8B–14B quantized
24 GB VRAM14B–32B quantized
48 GB+32B–70B quantized

Q4 सामान्य default; Q8 बेहतर पर भारी।

कार्य के अनुसार

तेज़ chat: gemma4:12b; code: Qwen Coder/Codestral; reasoning: बड़े Qwen/Gemma; vision: LLaVA/Qwen VL; documents: nomic-embed-text; TTS: Qwen3-TTS/Kyutai।

Prompts और settings

Facts के लिए 0.1-0.3, सामान्य काम के लिए 0.5-0.7, creativity के लिए 0.8+ temperature। Context देखें और persistent settings के लिए personas उपयोग करें।

समस्या निवारण

Download error पर ollama list, disk और raw error देखें। Slow response पर छोटा model, ollama ps, कम context। Memory issue पर Q4, 8B, एक model और Docker GPU/Ollama access जाँचें।

संबंधित दस्तावेज़