Práce s modely AI
Libre WebUI může ve stejném pracovním prostoru používat místní modely Ollama i cloudové modely přes pluginy. Model Manager ukazuje nainstalované a spuštěné modely Ollama, aktuální výsledky Ollama Library, položky Hugging Face GGUF a dostupné položky Ollama Cloud.
Výběr prvního modelu
Použijte je jako výchozí body a poté přepínejte podle hardwaru a úlohy:
| Model | Vhodné pro | Typické požadavky |
|---|---|---|
gemma4:12b | Rychlý obecný chat | 16 GB RAM nebo 8 GB VRAM |
qwen3.8:27b | Obecný chat, kódování, více jazyků | 32 GB RAM nebo 16–24 GB VRAM |
gemma4:26b | Silný chat s efektivitou MoE | 24 GB RAM nebo 16 GB VRAM |
gemma4:31b | Nejkvalitnější hustý místní chat | 32 GB RAM nebo 24 GB VRAM |
nomic-embed-text | Embeddingy dokumentů | Malý místní model embeddingů |
Velké modely jako 30B, 70B a MoE mohou být vynikající, ale potřebují mnohem více paměti. Pokud si nejste jistí, začněte menším a přejděte výš, až model poběží plynule.
Model Manager
Otevřete Settings → Models a můžete:
- Stahovat modely z Ollama podle názvu.
- Hledat v aktuální Ollama Library namísto statického seznamu.
- Zobrazit nainstalované a spuštěné modely.
- Aktualizovat všechny nainstalované modely Ollama v jedné operaci.
- Zastavit nebo uvolnit spuštěné modely.
- Smazat nepotřebné modely.
- Stahovat kompatibilní modely Hugging Face GGUF přes Ollama.
- Stahovat modely Ollama Cloud přes cloudový filtr.
U výsledků Ollama Cloud rozhraní před stažením normalizuje cloudové názvy. Když model
vyžaduje příponu :cloud nebo -cloud, Libre WebUI ji v cloudovém postupu doplní.
Katalog a viditelnost modelů
Model Catalog v Settings → Defaults uvádí všechny volitelné modely chatu, místní i od poskytovatelů, se štítkem poskytovatele a vyhledáváním. Výchozí model vyberte nad katalogem; s ním pak začínají nové chaty.
Správci mohou model označit hvězdičkou a připnout jej na začátek katalogu i nabídky výchozích modelů. Při více označených modelech je první ten naposledy označený; odebrání hvězdičky vrátí modelu jeho ruční pozici nebo pořadí podle poskytovatele.
Správci mají v každém řádku další ovládání: přepínač oka skryje model z výběrů ostatních. Skrytí zkrátí dlouhé katalogy na modely, které chce server skutečně nabízet. Jde o úpravu seznamu, nikoli autorizační bránu; chápejte ji jako správu nabídky, ne bezpečnostní hranici. Správci vždy vidí úplný seznam a skryté modely jsou označené.
Místní a cloudové modely
| Režim | Výhody | Nevýhody |
|---|---|---|
| Místní Ollama | Soukromí, offline po stažení, předvídatelná cena | Závisí na CPU/GPU/RAM |
| Ollama Cloud | Známý postup Ollama bez limitů místního hardwaru | Vyžaduje cloudový přístup a síť |
| Pluginy poskytovatelů | Přístup ke spravovaným modelům více poskytovatelů | Platí klíče API, ceny a zásady soukromí poskytovatele |
Místní modely můžete zachovat pro soukromou práci a pluginy zapnout pro úlohy, které potřebují větší hostované modely.
Výchozí model pro obraz
Můžete chatovat s rychlým textovým modelem a stále posílat obrázky. V Settings → Defaults → Specialized Models → Vision Model vyberte obrazový model. Kdykoli odchozí kontext obsahuje obrázky — novou přílohu, starší obrázek relace nebo historii anonymního chatu — tah se nasměruje na něj místo modelu relace. Textové tahy zůstanou u modelu relace.
Nastavení je pro jednotlivé uživatele a směrování je automatické a tiché. Volba Use the current chat model ho vypne. Kontrola se týká přítomnosti obrázků, nikoli schopností modelu relace: každý tah s obrázkem použije nastavený obrazový model, i když by původní model obrázky zvládl.
Volba ukládá přesnou identitu poskytovatele (Ollama nebo konkrétní plugin) s názvem modelu, takže poskytovatel nemůže převzít model stejného názvu. Když uložená volba identitu ztratí, například model či poskytovatel zmizí, tah s obrázkem selže. Opravíte to novým výběrem modelu v Settings → Defaults → Specialized Models → Vision Model. Hlasité selhání je záměrné; Libre WebUI potichu nenahradí poskytovatele.
Modely pro Work
Work potřebuje model chatu, který umí volat nástroje. Může použít:
- Nainstalovaný model Ollama, který oznamuje funkci
tools. - Model Ollama Cloud dostupný přes nastavený koncový bod Ollama.
- Model uvedený aktivním pluginem chatu či dokončování s přihlašovacími údaji aktuálního správce.
Běhy Work přes plugin používají odpovídající adaptér: OpenAI-kompatibilní, Anthropic nebo Gemini. Libre WebUI ukládá s úlohou i během přesný typ poskytovatele a ID pluginu, takže plugin nemůže převzít stejně pojmenovaný model Ollama. Pokud model či poskytovatel odmítne nástroje, běh selže namísto tichého přepnutí.
Místní Ollama drží požadavky v nastavené infrastruktuře Ollama. U vzdáleného modelu obdrží poskytovatel systémový prompt Work, konverzaci, definice nástrojů a jejich výsledky. Ty mohou obsahovat zdrojový text, výstup příkazů či seznamy adresářů. Svazky pracovních prostorů a přihlašovací údaje zůstávají na hostiteli backendu, ale obsah souboru ho může opustit ve výsledku nástroje.
Jeden autonomní běh Work může model volat opakovaně. Před citlivými projekty ověřte ceny a zásady uchovávání a trénování poskytovatele. Libre WebUI ve Work zobrazuje oznámení vzdáleného poskytovatele, které může každý uživatel skrýt.
Průvodce hardwarem
| Systém | Praktický rozsah modelů | Poznámky |
|---|---|---|
| Jen CPU, 8–16 GB RAM | 1B–4B | Lehký chat a testování |
| 8 GB VRAM | 4B–8B kvantizovaný | Pohodlný výchozí bod |
| 12–16 GB VRAM | 8B–14B kvantizovaný | Vhodné pro každodenní práci |
| 24 GB VRAM | 14B–32B kvantizovaný | Silná místní pracovní stanice |
| 48 GB+ VRAM nebo velká sdílená paměť | 32B–70B kvantizovaný | Experimenty s velkými modely |
Kvantizované modely používají méně paměti. Q4 je obvykle praktická výchozí volba; Q8 používá více paměti pro vyšší kvalitu.
Doporučení podle úlohy
| Úloha | Směr modelu |
|---|---|
| Rychlý chat | gemma4:12b a jiné malé aktuální modely |
| Kódování | Qwen Coder, Codestral, programovací modely poskytovatelů |
| Uvažování | Větší modely Qwen a Gemma a modely uvažování poskytovatelů |
| Obraz | Multimodální modely jako LLaVA, Qwen VL nebo obrazové modely |
| Hledání dokumentů | nomic-embed-text nebo jiný model embeddingů |
| Text na řeč | Pluginy TTS jako Qwen3-TTS nebo Kyutai TTS |
Názvy modelů poskytovatelů se často mění. Použijte jejich vyhledávání modelů v Libre WebUI nebo vložte přesné ID z řídicího panelu poskytovatele.
Prompty a nastavení
- Ovládání generování jako temperature, limity tokenů, délka kontextu a penalizace jsou v Advanced generation settings, ve výchozím stavu zavřené.
- Nižší temperature (
0.1-0.3) pro faktické a opakovatelné odpovědi. - Střední temperature (
0.5-0.7) pro běžnou práci asistenta. - Vyšší temperature (
0.8+) pro brainstorming a kreativní psaní. - Při blízkosti limitu paměti udržujte rozumnou délku kontextu.
- Pro trvalé parametry a opakovaný systémový prompt používejte persony.
Řešení problémů
Stažení selže
- Ověřte, že Ollama běží:
ollama list. - Zkuste stejný požadavek v terminálu a prohlédněte si původní chybu Ollama.
- Před stahováním velkých modelů zkontrolujte místo na disku.
- Při cloudovém filtru Model Manager nechte přípony spravovat Libre WebUI.
Odpovědi jsou pomalé
- Zkuste menší model nebo nižší kvantizaci.
- Pomocí
ollama pszkontrolujte načtené modely. - Zavřete další aplikace náročné na GPU.
- Zkraťte kontext.
Nedostatek paměti
- Přejděte z Q8 na Q4.
- Použijte model 8B místo 14B.
- Nechte načtený jen potřebný model.
- V Dockeru ověřte přístup kontejneru k GPU nebo instanci Ollama na hostiteli.