Ga naar hoofdinhoud

Lokale GPU-stack

Deze handleiding beschrijft de door de repository ondersteunde lokale GPU-configuratie: Ollama draait rechtstreeks op de host voor directe GPU-toegang en Libre WebUI draait in Docker met docker-compose.dev.external-ollama.yml.

Beschikbaarheid van Work

Ollama draait rechtstreeks op de GPU van de host. Work wordt ingeschakeld via de gekoppelde Docker-socket van de host, zodat Libre WebUI taakgebonden containers op dezelfde daemon kan maken. Er is geen rechtstreekse installatie van Libre WebUI op de host nodig.

De socket geeft rechten op de Docker-host die gelijkstaan aan rootrechten. Verwijder de koppeling als Work niet nodig is en stel op Linux DOCKER_GID in .env in.

Op computers met beperkt geheugen kan Work in plaats daarvan een Ollama Cloud-model of een geconfigureerde externe plug-in voor completions/chats gebruiken. Dat vermindert de lokale geheugendruk van het model, maar Docker blijft vereist voor de werkruimte en opdrachten van de taak.

Wat u krijgt

  • Libre WebUI met de image librewebui/libre-webui:dev.
  • Rechtstreeks op de host draaiende Ollama voor lokale modelinferentie.
  • Permanente gegevensvolumes van Libre WebUI.
  • Een duidelijk pad om de dev-image te testen zonder Ollama in een container te plaatsen.

Vereisten

OnderdeelVereiste
DockerDocker Desktop of Docker Engine met Compose v2
OllamaGeïnstalleerd en actief op de host
GPUOptioneel, maar aanbevolen voor lokale modellen
NVIDIAActueel stuurprogramma en NVIDIA Container Toolkit als u GPU-workloads in containers uitvoert
SchijfruimteVoldoende ruimte voor Ollama-modelbestanden

Ollama installeren en controleren

Linux:

curl -fsSL https://ollama.com/install.sh | sh

macOS:

brew install ollama
ollama serve

Haal een eerste model binnen:

ollama pull gemma4:12b

Controleer de API:

curl http://localhost:11434/api/version

Libre WebUI starten

Vanuit de hoofdmap van de repository:

docker compose -f docker-compose.dev.external-ollama.yml up -d

Open http://localhost:8080.

Aangepast Ollama-eindpunt

Als Ollama op een andere computer staat:

OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Voor Tailscale:

OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Aanbevolen modellen

Voor een eerste GPU-werkstation:

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Gebruik Model Manager om grotere modellen te ontdekken zodra de basisstack werkt.

LAN-toegang

Voeg de oorsprong van uw LAN of Tailscale toe aan CORS_ORIGIN in de Compose-omgeving voordat u de app voor een ander apparaat beschikbaar maakt:

CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080

Start daarna opnieuw:

docker compose -f docker-compose.dev.external-ollama.yml up -d

Nuttige opdrachten

docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d

Problemen oplossen

Container kan Ollama niet bereiken

docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version

Voeg op Linux het volgende toe:

extra_hosts:
- 'host.docker.internal:host-gateway'

Model draait op CPU

Rechtstreeks geïnstalleerde Ollama gebruikt de hostinstallatie. Controleer uw Ollama-installatie, GPU-stuurprogramma en ollama ps.

TTS nodig

Gebruik de serverhandleiding voor Qwen3-TTS, Kyutai TTS of LongCat AudioDiT en schakel daarna de bijbehorende plug-in in via Settings.

Gerelateerde documentatie