Lewati ke konten utama

Bekerja dengan model AI

Libre WebUI memakai model Ollama lokal dan model cloud melalui plugin dalam satu workspace. Pengelola menampilkan Ollama terpasang/berjalan, Ollama Library terbaru, GGUF Hugging Face, dan Ollama Cloud.

Memilih model pertama

ModelPenggunaanPerkiraan sumber daya
gemma4:12bChat cepat16 GB RAM atau 8 GB VRAM
qwen3.8:27bChat, kode, bahasa32 GB RAM atau 16–24 GB VRAM
gemma4:26bChat MoE kuat24 GB RAM atau 16 GB VRAM
gemma4:31bChat dense berkualitas32 GB RAM atau 24 GB VRAM
nomic-embed-textEmbedding dokumenModel lokal kecil

Model 30B, 70B, dan MoE memerlukan lebih banyak memori. Mulailah dari yang kecil.

Pengelola model

Di Pengaturan → Model, pull Ollama berdasarkan nama, cari Library, lihat/stop/delete model, perbarui seluruh model Ollama terpasang dalam satu operasi, serta pull GGUF Hugging Face atau Ollama Cloud. Libre menormalisasi suffix :cloud atau -cloud.

Katalog dan visibilitas

Katalog Model di Pengaturan → Bawaan menampilkan model lokal/penyedia dengan badge dan pencarian. Pilihan model bawaan di atas katalog menetapkan model yang dipakai chat baru.

Administrator dapat memberi bintang pada sebuah model untuk menyematkannya di puncak katalog dan menu model bawaan. Jika ada beberapa bintang, model yang paling baru dibintangi berada paling atas; menghapus bintang mengembalikan posisi semula model.

Administrator dapat menyembunyikan model dari selector pengguna lain; ini kurasi, bukan batas otorisasi.

Lokal dan cloud

ModeKelebihanKompromi
Ollama lokalPrivasi, offline, biaya terprediksiCPU/GPU/RAM
Ollama CloudAlur familiar tanpa batas lokalJaringan dan cloud
PluginModel terkelola dari beberapa penyediaAPI key, harga, privasi penyedia

Model vision bawaan

Pilih model terpisah di Pengaturan → Bawaan → Model khusus → Model vision. Setiap giliran berisi gambar menuju model itu; giliran teks tetap pada model sesi.

Identitas penyedia yang tepat disimpan. Jika identitas itu hilang — misalnya model atau penyedianya tidak tersedia lagi — giliran yang memuat gambar akan gagal. Pilih ulang model di Pengaturan → Bawaan → Model khusus → Model vision untuk memperbaikinya. Kegagalan yang terlihat jelas ini disengaja; Libre WebUI tidak diam-diam mengganti penyedia lain.

Model untuk Work

Diperlukan model chat dengan tools: Ollama yang mendeklarasikan tools, Ollama Cloud, atau plugin chat/completion aktif dengan model tepat dan credentials administrator. Work menggunakan adapter OpenAI-compatible, Anthropic, atau Gemini; tidak ada fallback.

Penyedia remote menerima prompt sistem Work, percakapan, definisi, dan hasil alat. Volume/credentials tetap di host, tetapi isi file dapat keluar sebagai hasil. Satu run dapat membuat banyak panggilan berbayar; periksa pricing, retention, dan training.

Hardware

SistemRentang praktis
CPU, 8–16 GB RAM1B–4B
8 GB VRAM4B–8B quantized
12–16 GB VRAM8B–14B quantized
24 GB VRAM14B–32B quantized
48 GB+32B–70B quantized

Q4 adalah bawaan praktis; Q8 lebih baik tetapi lebih berat.

Chat cepat: gemma4:12b; kode: Qwen Coder/Codestral; reasoning: Qwen/Gemma lebih besar; vision: LLaVA/Qwen VL; dokumen: nomic-embed-text; TTS: Qwen3-TTS/Kyutai.

Prompt dan pengaturan

Gunakan temperature 0.1-0.3 untuk fakta, 0.5-0.7 untuk pekerjaan biasa, dan 0.8+ untuk kreativitas. Pantau context dan gunakan persona untuk pengaturan persistent.

Pemecahan masalah

Untuk error download, periksa ollama list, disk, dan error mentah. Untuk respons lambat, gunakan model lebih kecil, ollama ps, dan context lebih pendek. Untuk kekurangan memori, gunakan Q4, 8B, satu model, dan periksa akses Docker ke GPU/Ollama.

Dokumen terkait