Bekerja dengan model AI
Libre WebUI memakai model Ollama lokal dan model cloud melalui plugin dalam satu workspace. Pengelola menampilkan Ollama terpasang/berjalan, Ollama Library terbaru, GGUF Hugging Face, dan Ollama Cloud.
Memilih model pertama
| Model | Penggunaan | Perkiraan sumber daya |
|---|---|---|
gemma4:12b | Chat cepat | 16 GB RAM atau 8 GB VRAM |
qwen3.8:27b | Chat, kode, bahasa | 32 GB RAM atau 16–24 GB VRAM |
gemma4:26b | Chat MoE kuat | 24 GB RAM atau 16 GB VRAM |
gemma4:31b | Chat dense berkualitas | 32 GB RAM atau 24 GB VRAM |
nomic-embed-text | Embedding dokumen | Model lokal kecil |
Model 30B, 70B, dan MoE memerlukan lebih banyak memori. Mulailah dari yang kecil.
Pengelola model
Di Pengaturan → Model, pull Ollama berdasarkan nama, cari Library, lihat/stop/delete model, perbarui seluruh model Ollama terpasang dalam satu operasi, serta pull GGUF Hugging Face atau Ollama Cloud. Libre menormalisasi suffix :cloud atau -cloud.
Katalog dan visibilitas
Katalog Model di Pengaturan → Bawaan menampilkan model lokal/penyedia dengan badge dan pencarian. Pilihan model bawaan di atas katalog menetapkan model yang dipakai chat baru.
Administrator dapat memberi bintang pada sebuah model untuk menyematkannya di puncak katalog dan menu model bawaan. Jika ada beberapa bintang, model yang paling baru dibintangi berada paling atas; menghapus bintang mengembalikan posisi semula model.
Administrator dapat menyembunyikan model dari selector pengguna lain; ini kurasi, bukan batas otorisasi.
Lokal dan cloud
| Mode | Kelebihan | Kompromi |
|---|---|---|
| Ollama lokal | Privasi, offline, biaya terprediksi | CPU/GPU/RAM |
| Ollama Cloud | Alur familiar tanpa batas lokal | Jaringan dan cloud |
| Plugin | Model terkelola dari beberapa penyedia | API key, harga, privasi penyedia |
Model vision bawaan
Pilih model terpisah di Pengaturan → Bawaan → Model khusus → Model vision. Setiap giliran berisi gambar menuju model itu; giliran teks tetap pada model sesi.
Identitas penyedia yang tepat disimpan. Jika identitas itu hilang — misalnya model atau penyedianya tidak tersedia lagi — giliran yang memuat gambar akan gagal. Pilih ulang model di Pengaturan → Bawaan → Model khusus → Model vision untuk memperbaikinya. Kegagalan yang terlihat jelas ini disengaja; Libre WebUI tidak diam-diam mengganti penyedia lain.
Model untuk Work
Diperlukan model chat dengan tools: Ollama yang mendeklarasikan tools, Ollama Cloud, atau plugin chat/completion aktif dengan model tepat dan credentials administrator. Work menggunakan adapter OpenAI-compatible, Anthropic, atau Gemini; tidak ada fallback.
Penyedia remote menerima prompt sistem Work, percakapan, definisi, dan hasil alat. Volume/credentials tetap di host, tetapi isi file dapat keluar sebagai hasil. Satu run dapat membuat banyak panggilan berbayar; periksa pricing, retention, dan training.
Hardware
| Sistem | Rentang praktis |
|---|---|
| CPU, 8–16 GB RAM | 1B–4B |
| 8 GB VRAM | 4B–8B quantized |
| 12–16 GB VRAM | 8B–14B quantized |
| 24 GB VRAM | 14B–32B quantized |
| 48 GB+ | 32B–70B quantized |
Q4 adalah bawaan praktis; Q8 lebih baik tetapi lebih berat.
Menurut tugas
Chat cepat: gemma4:12b; kode: Qwen Coder/Codestral; reasoning: Qwen/Gemma lebih besar; vision: LLaVA/Qwen VL; dokumen: nomic-embed-text; TTS: Qwen3-TTS/Kyutai.
Prompt dan pengaturan
Gunakan temperature 0.1-0.3 untuk fakta, 0.5-0.7 untuk pekerjaan biasa, dan 0.8+ untuk kreativitas. Pantau context dan gunakan persona untuk pengaturan persistent.
Pemecahan masalah
Untuk error download, periksa ollama list, disk, dan error mentah. Untuk respons lambat, gunakan model lebih kecil, ollama ps, dan context lebih pendek. Untuk kekurangan memori, gunakan Q4, 8B, satu model, dan periksa akses Docker ke GPU/Ollama.