Hardwarekrav
Libre WebUI's almindelige Chat-grænseflade er let. De fleste ressourcer bruges af lokale Ollama-modeller. Containerbaserede Work-opgaver kræver et særskilt budget til CPU, hukommelse, processer, image og projektlager.
Hurtig reference
| Hardware | Praktiske lokale modeller | Kommentar |
|---|---|---|
| 8 GB RAM, kun CPU | 1B–4B kvantiseret | God til test og let chat |
| 16 GB RAM, kun CPU | 4B–8B kvantiseret | Brugbar, langsommere end GPU |
| 8 GB VRAM | 4B–8B kvantiseret | God daglig lokal konfiguration |
| 12–16 GB VRAM | 8B–14B kvantiseret | Stærkt arbejdsstationsniveau |
| 24 GB VRAM | 14B–32B kvantiseret | Avanceret lokal brug |
| 48 GB+ VRAM eller stor samlet hukommelse | 32B–70B kvantiseret | Eksperimenter med store modeller |
Den faktiske hastighed afhænger af modelarkitektur, kvantisering, kontekstlængde, GPU-drivere og andre kørende processer.
Gode startmodeller
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Brug nomic-embed-text til dokument-embeddings, ikke som chatmodel.
VRAM sammenlignet med RAM
VRAM er den vigtigste faktor for lokal modelhastighed. Hvis modellen kan være i VRAM, bliver svarene betydeligt hurtigere. Overløb til system-RAM kan stadig fungere, men bliver langsommere. System-RAM er vigtigt til CPU-inferens, GPU-aflastning, lange kontekstvinduer og resten af appen.
Apple Silicon
Apple Silicon bruger samlet hukommelse som deles af modeller, operativsystem og apps. Maskiner med mere samlet hukommelse kan køre større kvantiserede modeller end VRAM-tallet på et system med separat GPU antyder. Efterlad hukommelse åt browser, backend og operativsystem.
NVIDIA
NVIDIA-GPU'er har normalt den bedste kompatibilitet til lokal inferens via CUDA. Brug aktuelle drivere, og verificer Docker-GPU-adgang, hvis Ollama kører i en container.
AMD og Intel
Stødet beror på Ollama og plattformens drivrutiner. CPU-inferens er stadig tilgængelig uden GPU-acceleration.
Minska minnesanvændningen
- Brug mindre modeller.
- Brug Q4 i stedet for Q8.
- Minska kontextlængdeen.
- Fjern modeller som ikke bruges.
- Hold dokument-embeddings separata fra valget af chattmodel.
Runtime-kapacitet for Work
Work tilføjer til containerresurser ud over WebUI og modelprocessen. Hver aktiv opgavescontainer har som standard 2 GB hukommelse, 2 processorer og 256 processer.
Backend tillader som standard to aktive containerbaserede opgaver i hele installationen og én per administrator. Det er grænser, ikke reservationer. Budgettér samtidigt til backend, browser, Docker, Ollama og opgavecontainer. På Apple Silicon konkurrerer alle dele om samme samlede hukommelsespulje.
Ollama Cloud eller en konfigureret fjernudbyder undviker at læse ind en stor model lokalt, men tar ikke bort Docker-kravet eller Work-containerns ressourcer.
Hver Work-opgave ejer også en navngiven Docker-diskenhed til genererede filer og lokale afhængigheder. Der findes ingen diskkvote per opgave; pakkeinstallationer kan fylde Docker-lageret. Overvåg Docker-dataroden, angiv værtsgrænser, hvor det er muligt, og sikkerhedskopiér Work-diskenheder separat fra databasen.
Justera WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT og WORK_MAX_ACTIVE_RUNTIMES_* først efter mætning. Se miljøvariabelreferensen.