Chuyển tới nội dung chính

Làm việc với model AI

Libre WebUI dùng model Ollama local và model cloud qua plugin trong một workspace. Trình quản lý hiển thị Ollama đã cài/đang chạy, Ollama Library mới nhất, GGUF Hugging Face và Ollama Cloud.

Chọn model đầu tiên

ModelSử dụngTài nguyên ước tính
gemma4:12bChat nhanh16 GB RAM hoặc 8 GB VRAM
qwen3.8:27bChat, code, ngôn ngữ32 GB RAM hoặc 16–24 GB VRAM
gemma4:26bChat MoE mạnh24 GB RAM hoặc 16 GB VRAM
gemma4:31bChat dense chất lượng32 GB RAM hoặc 24 GB VRAM
nomic-embed-textEmbedding documentModel local nhỏ

Model 30B, 70B và MoE cần nhiều memory hơn. Bắt đầu với model nhỏ.

Trình quản lý model

Trong Cài đặt → Models, pull Ollama theo tên, search Library, xem/stop/delete model, cập nhật mọi model Ollama đã cài trong một thao tác, pull GGUF Hugging Face hoặc Ollama Cloud. Libre chuẩn hóa suffix :cloud hoặc -cloud.

Catalog và visibility

Model Catalog trong Cài đặt → Mặc định hiển thị model local/provider với badge và search. Chọn model mặc định phía trên catalog để quyết định model cho chat mới. Administrator có thể gắn sao một model để ghim nó lên đầu catalog và menu model mặc định; gắn sao nhiều model thì model gắn gần nhất đứng trước, bỏ sao trả model về vị trí thủ công hoặc theo provider. Administrator cũng có thể ẩn model khỏi selector của user khác; đây là curation, không phải authorization boundary.

Local và cloud

ModeLợi íchĐánh đổi
Ollama localPrivacy, offline, chi phí dự đoán đượcCPU/GPU/RAM
Ollama CloudFlow quen thuộc không giới hạn localNetwork và cloud
PluginModel được quản lý từ nhiều providerAPI key, giá, privacy provider

Model vision mặc định

Chọn model riêng trong Cài đặt → Mặc định → Model chuyên dụng → Model vision. Mọi lượt có hình ảnh đi đến model đó; lượt text vẫn ở model session.

Danh tính provider chính xác được lưu. Nếu mất, lượt có hình ảnh sẽ lỗi; hãy chọn lại model trong Cài đặt → Mặc định → Model chuyên dụng → Model vision để sửa. Báo lỗi rõ ràng là có chủ ý; Libre WebUI không âm thầm thay bằng provider khác.

Model cho Work

Cần model chat có tools: Ollama khai báo tools, Ollama Cloud, hoặc plugin chat/completion active với model chính xác và credentials administrator. Work dùng adapter OpenAI-compatible, Anthropic hoặc Gemini; không fallback.

Provider remote nhận system prompt Work, hội thoại, definition và tool result. Volume/credentials ở host nhưng file content có thể đi ra như result. Một run có thể tạo nhiều paid call; kiểm tra pricing, retention và training.

Hardware

Hệ thốngPhạm vi thực tế
CPU, 8–16 GB RAM1B–4B
8 GB VRAM4B–8B quantized
12–16 GB VRAM8B–14B quantized
24 GB VRAM14B–32B quantized
48 GB+32B–70B quantized

Q4 là mặc định thực tế; Q8 tốt hơn nhưng nặng hơn.

Theo tác vụ

Chat nhanh: gemma4:12b; code: Qwen Coder/Codestral; reasoning: Qwen/Gemma lớn hơn; vision: LLaVA/Qwen VL; document: nomic-embed-text; TTS: Qwen3-TTS/Kyutai.

Prompt và cài đặt

Dùng temperature 0.1-0.3 cho fact, 0.5-0.7 cho công việc thường và 0.8+ cho sáng tạo. Theo dõi context và dùng persona cho cài đặt persistent.

Khắc phục sự cố

Khi download error, kiểm tra ollama list, disk và error thô. Với response chậm, dùng model nhỏ, ollama ps và context ngắn. Khi thiếu memory, dùng Q4, 8B, một model và kiểm tra Docker truy cập GPU/Ollama.

Tài liệu liên quan