Hoppa till huvudinnehåll

Maskinvarukrav

Libre WebUI:s vanliga Chat-gränssnitt är lättviktigt. De flesta resurser går till lokala Ollama-modeller. Containerbaserade Work-uppgifter kräver separat budget för processor, minne, processer, image och projektlagring.

Snabbreferens

MaskinvaraPraktiska lokala modellerKommentar
8 GB RAM, endast CPU1B–4B kvantiseradBra för test och lätt chatt
16 GB RAM, endast CPU4B–8B kvantiseradAnvändbar, långsammare än GPU
8 GB VRAM4B–8B kvantiseradBra daglig lokal konfiguration
12–16 GB VRAM8B–14B kvantiseradStark arbetsstationsnivå
24 GB VRAM14B–32B kvantiseradAvancerad lokal användning
48 GB+ VRAM eller stort enhetligt minne32B–70B kvantiseradExperiment med stora modeller

Verklig hastighet beror på arkitektur, kvantisering, kontextlängd, GPU-drivrutiner och andra processer.

Bra startmodeller

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Använd nomic-embed-text för dokument-embeddings, inte som chattmodell.

VRAM jämfört med RAM

VRAM påverkar lokal modellhastighet mest. Ryms modellen i VRAM blir svaren betydligt snabbare. Spill till system-RAM kan fungera men blir långsammare. System-RAM behövs för CPU-inferens, GPU-avlastning, långa kontextfönster och resten av appen.

Apple Silicon

Apple Silicon använder enhetligt minne som delas av modeller, operativsystem och appar. Maskiner med mer enhetligt minne kan köra större kvantiserade modeller än VRAM-talet på ett system med separat GPU antyder. Lämna minne åt webbläsare, backend och operativsystem.

NVIDIA

NVIDIA-GPU:er har vanligen bäst kompatibilitet för lokal inferens via CUDA. Använd aktuella drivrutiner och verifiera Docker-GPU-åtkomst om Ollama körs i container.

AMD och Intel

Stödet beror på Ollama och plattformens drivrutiner. CPU-inferens är fortfarande tillgänglig utan GPU-acceleration.

Minska minnesanvändningen

  • Använd mindre modeller.
  • Använd Q4 i stället för Q8.
  • Minska kontextlängden.
  • Ladda ur modeller som inte används.
  • Håll dokument-embeddings separata från valet av chattmodell.

Runtime-kapacitet för Work

Work lägger till containerresurser utöver WebUI och modellprocessen. Varje aktiv uppgiftscontainer har som standard 2 GB minne, 2 processorer och 256 processer.

Backend tillåter normalt två aktiva containerbaserade uppgifter i installationen och en per administratör. De är gränser, inte reservationer. Budgetera samtidigt för backend, webbläsare, Docker, Ollama och uppgiftscontainer. På Apple Silicon konkurrerar allt om samma minnespool.

Ollama Cloud eller en konfigurerad fjärrleverantör undviker att läsa in en stor modell lokalt, men tar inte bort Docker-kravet eller Work-containerns resurser.

Varje Work-uppgift äger även en namngiven Docker-volym för filer och beroenden. Det finns ingen diskkvot per uppgift; paketinstallationer kan fylla Docker-lagringen. Övervaka dataroten, sätt värdgränser och säkerhetskopiera Work-volymer separat från databasen.

Justera WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT och WORK_MAX_ACTIVE_RUNTIMES_* först efter mätning. Se miljövariabelreferensen.

Relaterade dokument