Přeskočit na hlavní obsah

Práce s modely AI

Libre WebUI může ve stejném pracovním prostoru používat místní modely Ollama i cloudové modely přes pluginy. Model Manager ukazuje nainstalované a spuštěné modely Ollama, aktuální výsledky Ollama Library, položky Hugging Face GGUF a dostupné položky Ollama Cloud.

Výběr prvního modelu

Použijte je jako výchozí body a poté přepínejte podle hardwaru a úlohy:

ModelVhodné proTypické požadavky
gemma4:12bRychlý obecný chat16 GB RAM nebo 8 GB VRAM
qwen3.8:27bObecný chat, kódování, více jazyků32 GB RAM nebo 16–24 GB VRAM
gemma4:26bSilný chat s efektivitou MoE24 GB RAM nebo 16 GB VRAM
gemma4:31bNejkvalitnější hustý místní chat32 GB RAM nebo 24 GB VRAM
nomic-embed-textEmbeddingy dokumentůMalý místní model embeddingů

Velké modely jako 30B, 70B a MoE mohou být vynikající, ale potřebují mnohem více paměti. Pokud si nejste jistí, začněte menším a přejděte výš, až model poběží plynule.

Model Manager

Otevřete Settings → Models a můžete:

  • Stahovat modely z Ollama podle názvu.
  • Hledat v aktuální Ollama Library namísto statického seznamu.
  • Zobrazit nainstalované a spuštěné modely.
  • Aktualizovat všechny nainstalované modely Ollama v jedné operaci.
  • Zastavit nebo uvolnit spuštěné modely.
  • Smazat nepotřebné modely.
  • Stahovat kompatibilní modely Hugging Face GGUF přes Ollama.
  • Stahovat modely Ollama Cloud přes cloudový filtr.

U výsledků Ollama Cloud rozhraní před stažením normalizuje cloudové názvy. Když model vyžaduje příponu :cloud nebo -cloud, Libre WebUI ji v cloudovém postupu doplní.

Katalog a viditelnost modelů

Model Catalog v Settings → Defaults uvádí všechny volitelné modely chatu, místní i od poskytovatelů, se štítkem poskytovatele a vyhledáváním. Výchozí model vyberte nad katalogem; s ním pak začínají nové chaty.

Správci mohou model označit hvězdičkou a připnout jej na začátek katalogu i nabídky výchozích modelů. Při více označených modelech je první ten naposledy označený; odebrání hvězdičky vrátí modelu jeho ruční pozici nebo pořadí podle poskytovatele.

Správci mají v každém řádku další ovládání: přepínač oka skryje model z výběrů ostatních. Skrytí zkrátí dlouhé katalogy na modely, které chce server skutečně nabízet. Jde o úpravu seznamu, nikoli autorizační bránu; chápejte ji jako správu nabídky, ne bezpečnostní hranici. Správci vždy vidí úplný seznam a skryté modely jsou označené.

Místní a cloudové modely

RežimVýhodyNevýhody
Místní OllamaSoukromí, offline po stažení, předvídatelná cenaZávisí na CPU/GPU/RAM
Ollama CloudZnámý postup Ollama bez limitů místního hardwaruVyžaduje cloudový přístup a síť
Pluginy poskytovatelůPřístup ke spravovaným modelům více poskytovatelůPlatí klíče API, ceny a zásady soukromí poskytovatele

Místní modely můžete zachovat pro soukromou práci a pluginy zapnout pro úlohy, které potřebují větší hostované modely.

Výchozí model pro obraz

Můžete chatovat s rychlým textovým modelem a stále posílat obrázky. V Settings → Defaults → Specialized Models → Vision Model vyberte obrazový model. Kdykoli odchozí kontext obsahuje obrázky — novou přílohu, starší obrázek relace nebo historii anonymního chatu — tah se nasměruje na něj místo modelu relace. Textové tahy zůstanou u modelu relace.

Nastavení je pro jednotlivé uživatele a směrování je automatické a tiché. Volba Use the current chat model ho vypne. Kontrola se týká přítomnosti obrázků, nikoli schopností modelu relace: každý tah s obrázkem použije nastavený obrazový model, i když by původní model obrázky zvládl.

Volba ukládá přesnou identitu poskytovatele (Ollama nebo konkrétní plugin) s názvem modelu, takže poskytovatel nemůže převzít model stejného názvu. Když uložená volba identitu ztratí, například model či poskytovatel zmizí, tah s obrázkem selže. Opravíte to novým výběrem modelu v Settings → Defaults → Specialized Models → Vision Model. Hlasité selhání je záměrné; Libre WebUI potichu nenahradí poskytovatele.

Modely pro Work

Work potřebuje model chatu, který umí volat nástroje. Může použít:

  • Nainstalovaný model Ollama, který oznamuje funkci tools.
  • Model Ollama Cloud dostupný přes nastavený koncový bod Ollama.
  • Model uvedený aktivním pluginem chatu či dokončování s přihlašovacími údaji aktuálního správce.

Běhy Work přes plugin používají odpovídající adaptér: OpenAI-kompatibilní, Anthropic nebo Gemini. Libre WebUI ukládá s úlohou i během přesný typ poskytovatele a ID pluginu, takže plugin nemůže převzít stejně pojmenovaný model Ollama. Pokud model či poskytovatel odmítne nástroje, běh selže namísto tichého přepnutí.

Místní Ollama drží požadavky v nastavené infrastruktuře Ollama. U vzdáleného modelu obdrží poskytovatel systémový prompt Work, konverzaci, definice nástrojů a jejich výsledky. Ty mohou obsahovat zdrojový text, výstup příkazů či seznamy adresářů. Svazky pracovních prostorů a přihlašovací údaje zůstávají na hostiteli backendu, ale obsah souboru ho může opustit ve výsledku nástroje.

Jeden autonomní běh Work může model volat opakovaně. Před citlivými projekty ověřte ceny a zásady uchovávání a trénování poskytovatele. Libre WebUI ve Work zobrazuje oznámení vzdáleného poskytovatele, které může každý uživatel skrýt.

Průvodce hardwarem

SystémPraktický rozsah modelůPoznámky
Jen CPU, 8–16 GB RAM1B–4BLehký chat a testování
8 GB VRAM4B–8B kvantizovanýPohodlný výchozí bod
12–16 GB VRAM8B–14B kvantizovanýVhodné pro každodenní práci
24 GB VRAM14B–32B kvantizovanýSilná místní pracovní stanice
48 GB+ VRAM nebo velká sdílená paměť32B–70B kvantizovanýExperimenty s velkými modely

Kvantizované modely používají méně paměti. Q4 je obvykle praktická výchozí volba; Q8 používá více paměti pro vyšší kvalitu.

Doporučení podle úlohy

ÚlohaSměr modelu
Rychlý chatgemma4:12b a jiné malé aktuální modely
KódováníQwen Coder, Codestral, programovací modely poskytovatelů
UvažováníVětší modely Qwen a Gemma a modely uvažování poskytovatelů
ObrazMultimodální modely jako LLaVA, Qwen VL nebo obrazové modely
Hledání dokumentůnomic-embed-text nebo jiný model embeddingů
Text na řečPluginy TTS jako Qwen3-TTS nebo Kyutai TTS

Názvy modelů poskytovatelů se často mění. Použijte jejich vyhledávání modelů v Libre WebUI nebo vložte přesné ID z řídicího panelu poskytovatele.

Prompty a nastavení

  • Ovládání generování jako temperature, limity tokenů, délka kontextu a penalizace jsou v Advanced generation settings, ve výchozím stavu zavřené.
  • Nižší temperature (0.1-0.3) pro faktické a opakovatelné odpovědi.
  • Střední temperature (0.5-0.7) pro běžnou práci asistenta.
  • Vyšší temperature (0.8+) pro brainstorming a kreativní psaní.
  • Při blízkosti limitu paměti udržujte rozumnou délku kontextu.
  • Pro trvalé parametry a opakovaný systémový prompt používejte persony.

Řešení problémů

Stažení selže

  • Ověřte, že Ollama běží: ollama list.
  • Zkuste stejný požadavek v terminálu a prohlédněte si původní chybu Ollama.
  • Před stahováním velkých modelů zkontrolujte místo na disku.
  • Při cloudovém filtru Model Manager nechte přípony spravovat Libre WebUI.

Odpovědi jsou pomalé

  • Zkuste menší model nebo nižší kvantizaci.
  • Pomocí ollama ps zkontrolujte načtené modely.
  • Zavřete další aplikace náročné na GPU.
  • Zkraťte kontext.

Nedostatek paměti

  • Přejděte z Q8 na Q4.
  • Použijte model 8B místo 14B.
  • Nechte načtený jen potřebný model.
  • V Dockeru ověřte přístup kontejneru k GPU nebo instanci Ollama na hostiteli.

Související dokumentace