Maskinvarukrav
Libre WebUI:s vanliga Chat-gränssnitt är lättviktigt. De flesta resurser går till lokala Ollama-modeller. Containerbaserade Work-uppgifter kräver separat budget för processor, minne, processer, image och projektlagring.
Snabbreferens
| Maskinvara | Praktiska lokala modeller | Kommentar |
|---|---|---|
| 8 GB RAM, endast CPU | 1B–4B kvantiserad | Bra för test och lätt chatt |
| 16 GB RAM, endast CPU | 4B–8B kvantiserad | Användbar, långsammare än GPU |
| 8 GB VRAM | 4B–8B kvantiserad | Bra daglig lokal konfiguration |
| 12–16 GB VRAM | 8B–14B kvantiserad | Stark arbetsstationsnivå |
| 24 GB VRAM | 14B–32B kvantiserad | Avancerad lokal användning |
| 48 GB+ VRAM eller stort enhetligt minne | 32B–70B kvantiserad | Experiment med stora modeller |
Verklig hastighet beror på arkitektur, kvantisering, kontextlängd, GPU-drivrutiner och andra processer.
Bra startmodeller
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Använd nomic-embed-text för dokument-embeddings, inte som chattmodell.
VRAM jämfört med RAM
VRAM påverkar lokal modellhastighet mest. Ryms modellen i VRAM blir svaren betydligt snabbare. Spill till system-RAM kan fungera men blir långsammare. System-RAM behövs för CPU-inferens, GPU-avlastning, långa kontextfönster och resten av appen.
Apple Silicon
Apple Silicon använder enhetligt minne som delas av modeller, operativsystem och appar. Maskiner med mer enhetligt minne kan köra större kvantiserade modeller än VRAM-talet på ett system med separat GPU antyder. Lämna minne åt webbläsare, backend och operativsystem.
NVIDIA
NVIDIA-GPU:er har vanligen bäst kompatibilitet för lokal inferens via CUDA. Använd aktuella drivrutiner och verifiera Docker-GPU-åtkomst om Ollama körs i container.
AMD och Intel
Stödet beror på Ollama och plattformens drivrutiner. CPU-inferens är fortfarande tillgänglig utan GPU-acceleration.
Minska minnesanvändningen
- Använd mindre modeller.
- Använd Q4 i stället för Q8.
- Minska kontextlängden.
- Ladda ur modeller som inte används.
- Håll dokument-embeddings separata från valet av chattmodell.
Runtime-kapacitet för Work
Work lägger till containerresurser utöver WebUI och modellprocessen. Varje aktiv uppgiftscontainer har som standard 2 GB minne, 2 processorer och 256 processer.
Backend tillåter normalt två aktiva containerbaserade uppgifter i installationen och en per administratör. De är gränser, inte reservationer. Budgetera samtidigt för backend, webbläsare, Docker, Ollama och uppgiftscontainer. På Apple Silicon konkurrerar allt om samma minnespool.
Ollama Cloud eller en konfigurerad fjärrleverantör undviker att läsa in en stor modell lokalt, men tar inte bort Docker-kravet eller Work-containerns resurser.
Varje Work-uppgift äger även en namngiven Docker-volym för filer och beroenden. Det finns ingen diskkvot per uppgift; paketinstallationer kan fylla Docker-lagringen. Övervaka dataroten, sätt värdgränser och säkerhetskopiera Work-volymer separat från databasen.
Justera WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT och WORK_MAX_ACTIVE_RUNTIMES_* först efter mätning. Se miljövariabelreferensen.