Požadavky na hardware
Běžné rozhraní Chat v Libre WebUI je nenáročné. Většinu prostředků spotřebují místní modely Ollama; úlohy Work v kontejnerech přidávají samostatný rozpočet pro CPU, paměť, procesy, image a projektové úložiště.
Rychlý přehled
| Hardware | Praktické místní modely | Poznámka |
|---|---|---|
| 8 GB RAM, jen CPU | kvantované 1B–4B | Vhodné pro testy a lehký chat |
| 16 GB RAM, jen CPU | kvantované 4B–8B | Použitelné, pomalejší než GPU |
| 8 GB VRAM | kvantované 4B–8B | Dobrá každodenní místní sestava |
| 12–16 GB VRAM | kvantované 8B–14B | Silná pracovní stanice |
| 24 GB VRAM | kvantované 14B–32B | Špičkové místní použití |
| 48 GB+ VRAM nebo velká sdílená paměť | kvantované 32B–70B | Experimenty s velkými modely |
Skutečná rychlost závisí na architektuře modelu, kvantování, délce kontextu, ovladačích GPU a dalších běžících procesech.
Doporučené startovní modely
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Model nomic-embed-text používejte pro embeddings dokumentů, nikoli jako chatový model.
VRAM oproti RAM
VRAM nejvíce ovlivňuje rychlost místního modelu. Pokud se model vejde celý do VRAM, odpovědi jsou výrazně rychlejší. Přelití do systémové RAM může stále fungovat, ale zpomalí se. Systémová RAM je důležitá pro inferenci na CPU, odkládání na GPU, dlouhá kontextová okna i zbytek aplikace.
Apple Silicon
Apple Silicon používá sdílenou paměť, takže model, operační systém a aplikace čerpají ze stejného fondu. Stroje s větší sdílenou pamětí mohou spouštět větší kvantované modely, než by naznačovala velikost VRAM samostatné GPU. Ponechte dostatek paměti pro prohlížeč, backend a operační systém.
NVIDIA
GPU NVIDIA obvykle nabízejí nejlepší kompatibilitu místní inference přes CUDA. Používejte aktuální ovladače a při Ollama v kontejnerech ověřte přístup Dockeru ke GPU.
AMD a Intel
Podpora AMD a Intel závisí na Ollama a ovladačích vaší platformy. Pokud akcelerace GPU není dostupná, zůstává inference na CPU.
Jak snížit spotřebu paměti
- Používejte menší modely.
- Použijte kvantování Q4 místo Q8.
- Snižte délku kontextu.
- Uvolněte modely, které nepoužíváte.
- Oddělte embeddings dokumentů od volby chatového modelu.
Kapacita runtime Work
Work přidává kontejnery nad rámec WebUI a procesu modelu. Každý aktivní kontejner úlohy má ve výchozím nastavení:
- 2 GB paměti;
- 2 CPU; a
- 256 procesů.
Backend ve výchozím stavu dovoluje dvě aktivní kontejnerové úlohy v celé instanci a jednu na administrátora. Jsou to limity, nikoli rezervace, ale provozovatel musí počítat současně s backendem, prohlížečem, Dockerem, Ollama i kontejnery úloh. Na Apple Silicon všechny nakonec soutěží o stejný fond sdílené paměti.
Ollama Cloud nebo nakonfigurovaný vzdálený plugin pomůže vyhnout se načtení velkého modelu do místní RAM/VRAM. Neodstraní však požadavek na Docker ani prostředky kontejneru Work.
Každá úloha Work také vlastní pojmenovaný Docker volume pro soubory a místní závislosti. Volumes momentálně nemají diskovou kvótu na úlohu; instalace balíčků může úložiště Dockeru zaplnit. Sledujte datový kořen Dockeru, nastavte hostitelské limity a zálohujte volumes Work odděleně od databáze.
Hodnoty WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT a WORK_MAX_ACTIVE_RUNTIMES_* měňte až po změření backendového hostitele. Výchozí hodnoty najdete v přehledu proměnných prostředí.