ทำงานกับโมเดล AI
Libre WebUI ใช้โมเดล Ollama local และโมเดล cloud ผ่าน plugin ใน workspace เดียว ตัวจัดการแสดง Ollama ที่ติดตั้ง/กำลังรัน Ollama Library ล่าสุด GGUF Hugging Face และ Ollama Cloud
เลือกโมเดลแรก
| โมเดล | การใช้ | ทรัพยากรโดยประมาณ |
|---|---|---|
gemma4:12b | Chat เร็ว | 16 GB RAM หรือ 8 GB VRAM |
qwen3.8:27b | Chat, code, ภาษา | 32 GB RAM หรือ 16–24 GB VRAM |
gemma4:26b | Chat MoE แข็งแรง | 24 GB RAM หรือ 16 GB VRAM |
gemma4:31b | Chat dense คุณภาพ | 32 GB RAM หรือ 24 GB VRAM |
nomic-embed-text | Embedding เอกสาร | โมเดล local ขนาดเล็ก |
โมเดล 30B, 70B และ MoE ต้องใช้ memory มากกว่า เริ่มจากโมเดลเล็ก
ตัวจัดการโมเดล
ใน การตั้งค่า → โมเดล pull Ollama ตามชื่อ ค้น Library ดู/stop/delete โมเดล อัปเดตโมเดล Ollama ที่ติดตั้งไว้ทั้งหมดในครั้งเดียว และ pull GGUF Hugging Face หรือ Ollama Cloud Libre ทำ suffix :cloud หรือ -cloud ให้เป็นมาตรฐาน
Catalog และ Visibility
Model Catalog ใน การตั้งค่า → ค่าเริ่มต้น แสดงโมเดล local/provider พร้อม badge และค้นหา เลือกโมเดลค่าเริ่มต้นเหนือ catalog เพื่อกำหนดโมเดลสำหรับ chat ใหม่ Administrator ติดดาวโมเดลเพื่อปักหมุดไว้บนสุดของ catalog และเมนูโมเดลค่าเริ่มต้นได้ หากติดดาวหลายโมเดล โมเดลที่ติดดาวล่าสุดจะอยู่ก่อน และเมื่อเอาดาวออก โมเดลจะกลับไปยังตำแหน่งเดิมตามการจัดเองหรือตาม provider Administrator ยังซ่อนโมเดลจาก selector ของ user อื่นได้ นี่คือ curation ไม่ใช่ authorization boundary
Local และ Cloud
| Mode | ข้อดี | ข้อแลกเปลี่ยน |
|---|---|---|
| Ollama local | ความเป็นส่วนตัว offline ค่าใช้จ่ายคาดเดาได้ | CPU/GPU/RAM |
| Ollama Cloud | flow คุ้นเคยโดยไม่มีขีดจำกัด local | เครือข่ายและ cloud |
| Plugin | โมเดล managed จากหลาย provider | API key ราคา และ privacy ของ provider |
โมเดล Vision ค่าเริ่มต้น
เลือกโมเดลแยกใน การตั้งค่า → ค่าเริ่มต้น → โมเดลเฉพาะ → โมเดล Vision ทุก turn ที่มีรูปไปโมเดลนี้ turn ข้อความอยู่ที่โมเดล session
เก็บ identity provider ที่ตรง หากหาย turn ที่มีรูปจะล้มเหลว ให้เลือกโมเดลใหม่ใน การตั้งค่า → ค่าเริ่มต้น → โมเดลเฉพาะ → โมเดล Vision เพื่อแก้ไข การแจ้งข้อผิดพลาดอย่างชัดเจนเป็นความตั้งใจ Libre WebUI จะไม่สลับไปใช้ provider อื่นเงียบ ๆ
โมเดลสำหรับ Work
ต้องมีโมเดล chat พร้อม tools ได้แก่ Ollama ที่ประกาศ tools, Ollama Cloud หรือ plugin chat/completion active พร้อมโมเดลตรงและ credentials administrator Work ใช้ adapter OpenAI-compatible, Anthropic หรือ Gemini ไม่มี fallback
Provider remote รับ system prompt Work, conversation, definition และ tool result Volume/credentials อยู่ host แต่ file content อาจออกเป็น result หนึ่ง run อาจเรียกแบบเสียเงินหลายครั้ง ตรวจ pricing, retention และ training
Hardware
| ระบบ | ช่วงใช้งานจริง |
|---|---|
| CPU, 8–16 GB RAM | 1B–4B |
| 8 GB VRAM | 4B–8B quantized |
| 12–16 GB VRAM | 8B–14B quantized |
| 24 GB VRAM | 14B–32B quantized |
| 48 GB+ | 32B–70B quantized |
Q4 เป็นค่าเริ่มต้นที่เหมาะ Q8 ดีกว่าแต่หนักกว่า
ตามงาน
Chat เร็ว: gemma4:12b; code: Qwen Coder/Codestral; reasoning: Qwen/Gemma ใหญ่; vision: LLaVA/Qwen VL; เอกสาร: nomic-embed-text; TTS: Qwen3-TTS/Kyutai
Prompt และการตั้งค่า
ใช้ temperature 0.1-0.3 สำหรับข้อเท็จจริง 0.5-0.7 สำหรับงานปกติ 0.8+ สำหรับความสร้างสรรค์ เฝ้าดู context และใช้ persona สำหรับการตั้งค่า persistent
การแก้ปัญหา
เมื่อ download error ให้ตรวจ ollama list, disk และ error ดิบ หาก response ช้า ใช้โมเดลเล็ก ollama ps และ context สั้น หาก memory ไม่พอ ใช้ Q4, 8B, โมเดลเดียว และตรวจ Docker เข้าถึง GPU/Ollama