Ga naar hoofdinhoud

Hardwarevereisten

De normale Chat-interface van Libre WebUI is lichtgewicht. Het grootste deel van het resourcegebruik komt van lokale Ollama-modellen; door containers ondersteunde Work-taken voegen afzonderlijke budgetten voor CPU, geheugen, processen, images en projectopslag toe.

Beknopt overzicht

HardwarePraktische lokale modellenOpmerkingen
8 GB RAM, alleen CPU1B-4B gekwantiseerdGeschikt voor tests en lichte chats
16 GB RAM, alleen CPU4B-8B gekwantiseerdBruikbaar, langzamer dan GPU
8 GB VRAM4B-8B gekwantiseerdGoede dagelijkse lokale configuratie
12-16 GB VRAM8B-14B gekwantiseerdKrachtig werkstationbereik
24 GB VRAM14B-32B gekwantiseerdHoogwaardig lokaal gebruik
48 GB+ VRAM of veel uniform geheugen32B-70B gekwantiseerdExperimenteren met grote modellen

De werkelijke snelheid hangt af van de modelarchitectuur, kwantisatie, contextlengte, GPU-stuurprogramma's en andere actieve processen.

Goede modellen om mee te beginnen

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Gebruik nomic-embed-text voor documentembeddings, niet als chatmodel.

VRAM tegenover RAM

VRAM is de belangrijkste factor voor de snelheid van lokale modellen. Als het model in het VRAM past, zijn antwoorden veel sneller. Als het naar systeem-RAM overloopt, kan het nog steeds werken maar is het langzamer.

Systeem-RAM is belangrijk voor CPU-inferentie, GPU-offload, lange contextvensters en het uitvoeren van de rest van de app.

Apple Silicon

Apple Silicon gebruikt uniform geheugen. Modelgeheugen komt daardoor uit dezelfde pool als het besturingssysteem en de toepassingen. Computers met meer uniform geheugen kunnen grotere gekwantiseerde modellen uitvoeren dan hun hoeveelheid GPU-VRAM op een systeem met een losse GPU zou doen vermoeden.

Houd voldoende geheugen vrij voor de browser, backend en het besturingssysteem.

NVIDIA

NVIDIA-GPU's bieden via CUDA doorgaans de beste compatibiliteit voor lokale inferentie. Gebruik actuele stuurprogramma's en controleer de GPU-toegang van Docker wanneer Ollama in containers draait.

AMD en Intel

Ondersteuning voor AMD en Intel is afhankelijk van de ondersteuning door Ollama en de stuurprogramma's voor uw platform. CPU-inferentie blijft beschikbaar wanneer er geen GPU-versnelling is.

Geheugengebruik verminderen

  • Gebruik kleinere modellen.
  • Gebruik Q4-kwantisatie in plaats van Q8.
  • Verlaag de contextlengte.
  • Ontlaad modellen die u niet gebruikt.
  • Houd documentembeddings los van de keuze van het chatmodel.

Capaciteit van de Work-runtime

Work voegt containerresources toe boven op de WebUI en het modelproces. Elke actieve taakcontainer krijgt standaard:

  • 2 GB geheugen;
  • 2 CPU's; en
  • 256 processen.

De backend staat standaard twee actieve door containers ondersteunde taken op de hele instantie en één per beheerder toe. Dit zijn limieten, geen reserveringen, maar beheerders moeten tegelijk ruimte begroten voor de WebUI-backend, browser, Docker, Ollama en taakcontainer. Op Apple Silicon concurreren ze uiteindelijk allemaal om dezelfde pool met uniform geheugen.

Met Ollama Cloud of een geconfigureerde plug-in voor een extern model hoeft u geen groot model in lokaal RAM of VRAM te laden. Dit neemt de Docker-vereiste of de resources voor de Work-container niet weg.

Elke Work-taak bezit ook een benoemd Docker-volume voor gegenereerde bestanden en lokale afhankelijkheden. Volumes hebben momenteel geen schijfquota per taak, waardoor pakketinstallaties of gegenereerde projecten de Docker-opslag kunnen uitputten. Bewaak de Docker-gegevensmap, stel waar mogelijk limieten op hostniveau in en maak los van de Libre WebUI-database een back-up van taakvolumes.

Stem de instellingen WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT en WORK_MAX_ACTIVE_RUNTIMES_* pas af nadat u de backendhost hebt gemeten. Zie de referentie voor omgevingsvariabelen voor de standaardwaarden.

Gerelateerde documentatie