Làm việc với model AI
Libre WebUI dùng model Ollama local và model cloud qua plugin trong một workspace. Trình quản lý hiển thị Ollama đã cài/đang chạy, Ollama Library mới nhất, GGUF Hugging Face và Ollama Cloud.
Chọn model đầu tiên
| Model | Sử dụng | Tài nguyên ước tính |
|---|---|---|
gemma4:12b | Chat nhanh | 16 GB RAM hoặc 8 GB VRAM |
qwen3.8:27b | Chat, code, ngôn ngữ | 32 GB RAM hoặc 16–24 GB VRAM |
gemma4:26b | Chat MoE mạnh | 24 GB RAM hoặc 16 GB VRAM |
gemma4:31b | Chat dense chất lượng | 32 GB RAM hoặc 24 GB VRAM |
nomic-embed-text | Embedding document | Model local nhỏ |
Model 30B, 70B và MoE cần nhiều memory hơn. Bắt đầu với model nhỏ.
Trình quản lý model
Trong Cài đặt → Models, pull Ollama theo tên, search Library, xem/stop/delete model, cập nhật mọi model Ollama đã cài trong một thao tác, pull GGUF Hugging Face hoặc Ollama Cloud. Libre chuẩn hóa suffix :cloud hoặc -cloud.
Catalog và visibility
Model Catalog trong Cài đặt → Mặc định hiển thị model local/provider với badge và search. Chọn model mặc định phía trên catalog để quyết định model cho chat mới. Administrator có thể gắn sao một model để ghim nó lên đầu catalog và menu model mặc định; gắn sao nhiều model thì model gắn gần nhất đứng trước, bỏ sao trả model về vị trí thủ công hoặc theo provider. Administrator cũng có thể ẩn model khỏi selector của user khác; đây là curation, không phải authorization boundary.
Local và cloud
| Mode | Lợi ích | Đánh đổi |
|---|---|---|
| Ollama local | Privacy, offline, chi phí dự đoán được | CPU/GPU/RAM |
| Ollama Cloud | Flow quen thuộc không giới hạn local | Network và cloud |
| Plugin | Model được quản lý từ nhiều provider | API key, giá, privacy provider |
Model vision mặc định
Chọn model riêng trong Cài đặt → Mặc định → Model chuyên dụng → Model vision. Mọi lượt có hình ảnh đi đến model đó; lượt text vẫn ở model session.
Danh tính provider chính xác được lưu. Nếu mất, lượt có hình ảnh sẽ lỗi; hãy chọn lại model trong Cài đặt → Mặc định → Model chuyên dụng → Model vision để sửa. Báo lỗi rõ ràng là có chủ ý; Libre WebUI không âm thầm thay bằng provider khác.
Model cho Work
Cần model chat có tools: Ollama khai báo tools, Ollama Cloud, hoặc plugin chat/completion active với model chính xác và credentials administrator. Work dùng adapter OpenAI-compatible, Anthropic hoặc Gemini; không fallback.
Provider remote nhận system prompt Work, hội thoại, definition và tool result. Volume/credentials ở host nhưng file content có thể đi ra như result. Một run có thể tạo nhiều paid call; kiểm tra pricing, retention và training.
Hardware
| Hệ thống | Phạm vi thực tế |
|---|---|
| CPU, 8–16 GB RAM | 1B–4B |
| 8 GB VRAM | 4B–8B quantized |
| 12–16 GB VRAM | 8B–14B quantized |
| 24 GB VRAM | 14B–32B quantized |
| 48 GB+ | 32B–70B quantized |
Q4 là mặc định thực tế; Q8 tốt hơn nhưng nặng hơn.
Theo tác vụ
Chat nhanh: gemma4:12b; code: Qwen Coder/Codestral; reasoning: Qwen/Gemma lớn hơn; vision: LLaVA/Qwen VL; document: nomic-embed-text; TTS: Qwen3-TTS/Kyutai.
Prompt và cài đặt
Dùng temperature 0.1-0.3 cho fact, 0.5-0.7 cho công việc thường và 0.8+ cho sáng tạo. Theo dõi context và dùng persona cho cài đặt persistent.
Khắc phục sự cố
Khi download error, kiểm tra ollama list, disk và error thô. Với response chậm, dùng model nhỏ, ollama ps và context ngắn. Khi thiếu memory, dùng Q4, 8B, một model và kiểm tra Docker truy cập GPU/Ollama.