Hop til hovedindhold

Hardwarekrav

Libre WebUI's almindelige Chat-grænseflade er let. De fleste ressourcer bruges af lokale Ollama-modeller. Containerbaserede Work-opgaver kræver et særskilt budget til CPU, hukommelse, processer, image og projektlager.

Hurtig reference

HardwarePraktiske lokale modellerKommentar
8 GB RAM, kun CPU1B–4B kvantiseretGod til test og let chat
16 GB RAM, kun CPU4B–8B kvantiseretBrugbar, langsommere end GPU
8 GB VRAM4B–8B kvantiseretGod daglig lokal konfiguration
12–16 GB VRAM8B–14B kvantiseretStærkt arbejdsstationsniveau
24 GB VRAM14B–32B kvantiseretAvanceret lokal brug
48 GB+ VRAM eller stor samlet hukommelse32B–70B kvantiseretEksperimenter med store modeller

Den faktiske hastighed afhænger af modelarkitektur, kvantisering, kontekstlængde, GPU-drivere og andre kørende processer.

Gode startmodeller

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Brug nomic-embed-text til dokument-embeddings, ikke som chatmodel.

VRAM sammenlignet med RAM

VRAM er den vigtigste faktor for lokal modelhastighed. Hvis modellen kan være i VRAM, bliver svarene betydeligt hurtigere. Overløb til system-RAM kan stadig fungere, men bliver langsommere. System-RAM er vigtigt til CPU-inferens, GPU-aflastning, lange kontekstvinduer og resten af appen.

Apple Silicon

Apple Silicon bruger samlet hukommelse som deles af modeller, operativsystem og apps. Maskiner med mere samlet hukommelse kan køre større kvantiserede modeller end VRAM-tallet på et system med separat GPU antyder. Efterlad hukommelse åt browser, backend og operativsystem.

NVIDIA

NVIDIA-GPU'er har normalt den bedste kompatibilitet til lokal inferens via CUDA. Brug aktuelle drivere, og verificer Docker-GPU-adgang, hvis Ollama kører i en container.

AMD og Intel

Stødet beror på Ollama og plattformens drivrutiner. CPU-inferens er stadig tilgængelig uden GPU-acceleration.

Minska minnesanvændningen

  • Brug mindre modeller.
  • Brug Q4 i stedet for Q8.
  • Minska kontextlængdeen.
  • Fjern modeller som ikke bruges.
  • Hold dokument-embeddings separata fra valget af chattmodel.

Runtime-kapacitet for Work

Work tilføjer til containerresurser ud over WebUI og modelprocessen. Hver aktiv opgavescontainer har som standard 2 GB hukommelse, 2 processorer og 256 processer.

Backend tillader som standard to aktive containerbaserede opgaver i hele installationen og én per administrator. Det er grænser, ikke reservationer. Budgettér samtidigt til backend, browser, Docker, Ollama og opgavecontainer. På Apple Silicon konkurrerer alle dele om samme samlede hukommelsespulje.

Ollama Cloud eller en konfigureret fjernudbyder undviker at læse ind en stor model lokalt, men tar ikke bort Docker-kravet eller Work-containerns ressourcer.

Hver Work-opgave ejer også en navngiven Docker-diskenhed til genererede filer og lokale afhængigheder. Der findes ingen diskkvote per opgave; pakkeinstallationer kan fylde Docker-lageret. Overvåg Docker-dataroden, angiv værtsgrænser, hvor det er muligt, og sikkerhedskopiér Work-diskenheder separat fra databasen.

Justera WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT og WORK_MAX_ACTIVE_RUNTIMES_* først efter mætning. Se miljøvariabelreferensen.

Relaterede dokumenter