Lokale GPU-stack
Deze handleiding beschrijft de door de repository ondersteunde lokale GPU-configuratie: Ollama draait rechtstreeks op de host voor directe GPU-toegang en Libre WebUI draait in Docker met docker-compose.dev.external-ollama.yml.
Beschikbaarheid van Work
Ollama draait rechtstreeks op de GPU van de host. Work wordt ingeschakeld via de gekoppelde Docker-socket van de host, zodat Libre WebUI taakgebonden containers op dezelfde daemon kan maken. Er is geen rechtstreekse installatie van Libre WebUI op de host nodig.
De socket geeft rechten op de Docker-host die gelijkstaan aan rootrechten. Verwijder de koppeling als Work niet nodig is en stel op Linux DOCKER_GID in .env in.
Op computers met beperkt geheugen kan Work in plaats daarvan een Ollama Cloud-model of een geconfigureerde externe plug-in voor completions/chats gebruiken. Dat vermindert de lokale geheugendruk van het model, maar Docker blijft vereist voor de werkruimte en opdrachten van de taak.
Wat u krijgt
- Libre WebUI met de image
librewebui/libre-webui:dev. - Rechtstreeks op de host draaiende Ollama voor lokale modelinferentie.
- Permanente gegevensvolumes van Libre WebUI.
- Een duidelijk pad om de dev-image te testen zonder Ollama in een container te plaatsen.
Vereisten
| Onderdeel | Vereiste |
|---|---|
| Docker | Docker Desktop of Docker Engine met Compose v2 |
| Ollama | Geïnstalleerd en actief op de host |
| GPU | Optioneel, maar aanbevolen voor lokale modellen |
| NVIDIA | Actueel stuurprogramma en NVIDIA Container Toolkit als u GPU-workloads in containers uitvoert |
| Schijfruimte | Voldoende ruimte voor Ollama-modelbestanden |
Ollama installeren en controleren
Linux:
curl -fsSL https://ollama.com/install.sh | sh
macOS:
brew install ollama
ollama serve
Haal een eerste model binnen:
ollama pull gemma4:12b
Controleer de API:
curl http://localhost:11434/api/version
Libre WebUI starten
Vanuit de hoofdmap van de repository:
docker compose -f docker-compose.dev.external-ollama.yml up -d
Open http://localhost:8080.
Aangepast Ollama-eindpunt
Als Ollama op een andere computer staat:
OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Voor Tailscale:
OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Aanbevolen modellen
Voor een eerste GPU-werkstation:
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Gebruik Model Manager om grotere modellen te ontdekken zodra de basisstack werkt.
LAN-toegang
Voeg de oorsprong van uw LAN of Tailscale toe aan CORS_ORIGIN in de Compose-omgeving voordat u de app voor een ander apparaat beschikbaar maakt:
CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080
Start daarna opnieuw:
docker compose -f docker-compose.dev.external-ollama.yml up -d
Nuttige opdrachten
docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d
Problemen oplossen
Container kan Ollama niet bereiken
docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version
Voeg op Linux het volgende toe:
extra_hosts:
- 'host.docker.internal:host-gateway'
Model draait op CPU
Rechtstreeks geïnstalleerde Ollama gebruikt de hostinstallatie. Controleer uw Ollama-installatie, GPU-stuurprogramma en ollama ps.
TTS nodig
Gebruik de serverhandleiding voor Qwen3-TTS, Kyutai TTS of LongCat AudioDiT en schakel daarna de bijbehorende plug-in in via Settings.