Přeskočit na hlavní obsah

Požadavky na hardware

Běžné rozhraní Chat v Libre WebUI je nenáročné. Většinu prostředků spotřebují místní modely Ollama; úlohy Work v kontejnerech přidávají samostatný rozpočet pro CPU, paměť, procesy, image a projektové úložiště.

Rychlý přehled

HardwarePraktické místní modelyPoznámka
8 GB RAM, jen CPUkvantované 1B–4BVhodné pro testy a lehký chat
16 GB RAM, jen CPUkvantované 4B–8BPoužitelné, pomalejší než GPU
8 GB VRAMkvantované 4B–8BDobrá každodenní místní sestava
12–16 GB VRAMkvantované 8B–14BSilná pracovní stanice
24 GB VRAMkvantované 14B–32BŠpičkové místní použití
48 GB+ VRAM nebo velká sdílená paměťkvantované 32B–70BExperimenty s velkými modely

Skutečná rychlost závisí na architektuře modelu, kvantování, délce kontextu, ovladačích GPU a dalších běžících procesech.

Doporučené startovní modely

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Model nomic-embed-text používejte pro embeddings dokumentů, nikoli jako chatový model.

VRAM oproti RAM

VRAM nejvíce ovlivňuje rychlost místního modelu. Pokud se model vejde celý do VRAM, odpovědi jsou výrazně rychlejší. Přelití do systémové RAM může stále fungovat, ale zpomalí se. Systémová RAM je důležitá pro inferenci na CPU, odkládání na GPU, dlouhá kontextová okna i zbytek aplikace.

Apple Silicon

Apple Silicon používá sdílenou paměť, takže model, operační systém a aplikace čerpají ze stejného fondu. Stroje s větší sdílenou pamětí mohou spouštět větší kvantované modely, než by naznačovala velikost VRAM samostatné GPU. Ponechte dostatek paměti pro prohlížeč, backend a operační systém.

NVIDIA

GPU NVIDIA obvykle nabízejí nejlepší kompatibilitu místní inference přes CUDA. Používejte aktuální ovladače a při Ollama v kontejnerech ověřte přístup Dockeru ke GPU.

AMD a Intel

Podpora AMD a Intel závisí na Ollama a ovladačích vaší platformy. Pokud akcelerace GPU není dostupná, zůstává inference na CPU.

Jak snížit spotřebu paměti

  • Používejte menší modely.
  • Použijte kvantování Q4 místo Q8.
  • Snižte délku kontextu.
  • Uvolněte modely, které nepoužíváte.
  • Oddělte embeddings dokumentů od volby chatového modelu.

Kapacita runtime Work

Work přidává kontejnery nad rámec WebUI a procesu modelu. Každý aktivní kontejner úlohy má ve výchozím nastavení:

  • 2 GB paměti;
  • 2 CPU; a
  • 256 procesů.

Backend ve výchozím stavu dovoluje dvě aktivní kontejnerové úlohy v celé instanci a jednu na administrátora. Jsou to limity, nikoli rezervace, ale provozovatel musí počítat současně s backendem, prohlížečem, Dockerem, Ollama i kontejnery úloh. Na Apple Silicon všechny nakonec soutěží o stejný fond sdílené paměti.

Ollama Cloud nebo nakonfigurovaný vzdálený plugin pomůže vyhnout se načtení velkého modelu do místní RAM/VRAM. Neodstraní však požadavek na Docker ani prostředky kontejneru Work.

Každá úloha Work také vlastní pojmenovaný Docker volume pro soubory a místní závislosti. Volumes momentálně nemají diskovou kvótu na úlohu; instalace balíčků může úložiště Dockeru zaplnit. Sledujte datový kořen Dockeru, nastavte hostitelské limity a zálohujte volumes Work odděleně od databáze.

Hodnoty WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT a WORK_MAX_ACTIVE_RUNTIMES_* měňte až po změření backendového hostitele. Výchozí hodnoty najdete v přehledu proměnných prostředí.

Související dokumentace