ข้ามไปยังเนื้อหาหลัก

ทำงานกับโมเดล AI

Libre WebUI ใช้โมเดล Ollama local และโมเดล cloud ผ่าน plugin ใน workspace เดียว ตัวจัดการแสดง Ollama ที่ติดตั้ง/กำลังรัน Ollama Library ล่าสุด GGUF Hugging Face และ Ollama Cloud

เลือกโมเดลแรก

โมเดลการใช้ทรัพยากรโดยประมาณ
gemma4:12bChat เร็ว16 GB RAM หรือ 8 GB VRAM
qwen3.8:27bChat, code, ภาษา32 GB RAM หรือ 16–24 GB VRAM
gemma4:26bChat MoE แข็งแรง24 GB RAM หรือ 16 GB VRAM
gemma4:31bChat dense คุณภาพ32 GB RAM หรือ 24 GB VRAM
nomic-embed-textEmbedding เอกสารโมเดล local ขนาดเล็ก

โมเดล 30B, 70B และ MoE ต้องใช้ memory มากกว่า เริ่มจากโมเดลเล็ก

ตัวจัดการโมเดล

ใน การตั้งค่า → โมเดล pull Ollama ตามชื่อ ค้น Library ดู/stop/delete โมเดล อัปเดตโมเดล Ollama ที่ติดตั้งไว้ทั้งหมดในครั้งเดียว และ pull GGUF Hugging Face หรือ Ollama Cloud Libre ทำ suffix :cloud หรือ -cloud ให้เป็นมาตรฐาน

Catalog และ Visibility

Model Catalog ใน การตั้งค่า → ค่าเริ่มต้น แสดงโมเดล local/provider พร้อม badge และค้นหา เลือกโมเดลค่าเริ่มต้นเหนือ catalog เพื่อกำหนดโมเดลสำหรับ chat ใหม่ Administrator ติดดาวโมเดลเพื่อปักหมุดไว้บนสุดของ catalog และเมนูโมเดลค่าเริ่มต้นได้ หากติดดาวหลายโมเดล โมเดลที่ติดดาวล่าสุดจะอยู่ก่อน และเมื่อเอาดาวออก โมเดลจะกลับไปยังตำแหน่งเดิมตามการจัดเองหรือตาม provider Administrator ยังซ่อนโมเดลจาก selector ของ user อื่นได้ นี่คือ curation ไม่ใช่ authorization boundary

Local และ Cloud

Modeข้อดีข้อแลกเปลี่ยน
Ollama localความเป็นส่วนตัว offline ค่าใช้จ่ายคาดเดาได้CPU/GPU/RAM
Ollama Cloudflow คุ้นเคยโดยไม่มีขีดจำกัด localเครือข่ายและ cloud
Pluginโมเดล managed จากหลาย providerAPI key ราคา และ privacy ของ provider

โมเดล Vision ค่าเริ่มต้น

เลือกโมเดลแยกใน การตั้งค่า → ค่าเริ่มต้น → โมเดลเฉพาะ → โมเดล Vision ทุก turn ที่มีรูปไปโมเดลนี้ turn ข้อความอยู่ที่โมเดล session

เก็บ identity provider ที่ตรง หากหาย turn ที่มีรูปจะล้มเหลว ให้เลือกโมเดลใหม่ใน การตั้งค่า → ค่าเริ่มต้น → โมเดลเฉพาะ → โมเดล Vision เพื่อแก้ไข การแจ้งข้อผิดพลาดอย่างชัดเจนเป็นความตั้งใจ Libre WebUI จะไม่สลับไปใช้ provider อื่นเงียบ ๆ

โมเดลสำหรับ Work

ต้องมีโมเดล chat พร้อม tools ได้แก่ Ollama ที่ประกาศ tools, Ollama Cloud หรือ plugin chat/completion active พร้อมโมเดลตรงและ credentials administrator Work ใช้ adapter OpenAI-compatible, Anthropic หรือ Gemini ไม่มี fallback

Provider remote รับ system prompt Work, conversation, definition และ tool result Volume/credentials อยู่ host แต่ file content อาจออกเป็น result หนึ่ง run อาจเรียกแบบเสียเงินหลายครั้ง ตรวจ pricing, retention และ training

Hardware

ระบบช่วงใช้งานจริง
CPU, 8–16 GB RAM1B–4B
8 GB VRAM4B–8B quantized
12–16 GB VRAM8B–14B quantized
24 GB VRAM14B–32B quantized
48 GB+32B–70B quantized

Q4 เป็นค่าเริ่มต้นที่เหมาะ Q8 ดีกว่าแต่หนักกว่า

ตามงาน

Chat เร็ว: gemma4:12b; code: Qwen Coder/Codestral; reasoning: Qwen/Gemma ใหญ่; vision: LLaVA/Qwen VL; เอกสาร: nomic-embed-text; TTS: Qwen3-TTS/Kyutai

Prompt และการตั้งค่า

ใช้ temperature 0.1-0.3 สำหรับข้อเท็จจริง 0.5-0.7 สำหรับงานปกติ 0.8+ สำหรับความสร้างสรรค์ เฝ้าดู context และใช้ persona สำหรับการตั้งค่า persistent

การแก้ปัญหา

เมื่อ download error ให้ตรวจ ollama list, disk และ error ดิบ หาก response ช้า ใช้โมเดลเล็ก ollama ps และ context สั้น หาก memory ไม่พอ ใช้ Q4, 8B, โมเดลเดียว และตรวจ Docker เข้าถึง GPU/Ollama

เอกสารที่เกี่ยวข้อง