Pile GPU locale
Ce guide décrit la configuration GPU locale prise en charge par le dépôt : Ollama s'exécute nativement sur l'hôte pour accéder directement au GPU, tandis que Libre WebUI s'exécute dans Docker avec docker-compose.dev.external-ollama.yml.
Disponibilité de Work
Ollama s'exécute nativement sur le GPU de l'hôte. Work est activé grâce au socket Docker de l'hôte monté, ce qui permet à Libre WebUI de créer des conteneurs propres aux tâches sur le même démon. Il n'est pas nécessaire d'installer Libre WebUI nativement.
Le socket confère un contrôle de l'hôte Docker équivalent à celui de l'utilisateur root. Retirez son montage
sauf si Work est nécessaire et, sous Linux, définissez DOCKER_GID dans .env.
Sur les machines à mémoire limitée, Work peut utiliser à la place un modèle Ollama Cloud ou une extension de complétion ou de chat distante configurée. Cela réduit la pression sur la mémoire du modèle local, mais Docker reste nécessaire pour l'espace de travail et les commandes de la tâche.
Ce que vous obtenez
- Libre WebUI utilisant l'image
librewebui/libre-webui:dev. - Ollama natif sur l'hôte pour l'inférence des modèles locaux.
- Des volumes de données Libre WebUI persistants.
- Une méthode simple pour tester l'image dev sans placer Ollama dans un conteneur.
Prérequis
| Composant | Prérequis |
|---|---|
| Docker | Docker Desktop ou Docker Engine avec Compose v2 |
| Ollama | Installé et en cours d'exécution sur l'hôte |
| GPU | Facultatif, mais recommandé pour les modèles locaux |
| NVIDIA | Pilote à jour et NVIDIA Container Toolkit si les tâches GPU sont conteneurisées |
| Disque | Espace suffisant pour les fichiers des modèles Ollama |
Installer et vérifier Ollama
Linux :
curl -fsSL https://ollama.com/install.sh | sh
macOS :
brew install ollama
ollama serve
Téléchargez un premier modèle :
ollama pull gemma4:12b
Vérifiez l'API :
curl http://localhost:11434/api/version
Démarrer Libre WebUI
Depuis la racine du dépôt :
docker compose -f docker-compose.dev.external-ollama.yml up -d
Ouvrez http://localhost:8080.
Point de terminaison Ollama personnalisé
Si Ollama se trouve sur une autre machine :
OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Avec Tailscale :
OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Modèles recommandés
Pour une première station de travail dotée d'un GPU :
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Utilisez le gestionnaire de modèles pour découvrir de plus grands modèles une fois la pile de base opérationnelle.
Accès sur le réseau local
Ajoutez votre origine sur le réseau local ou Tailscale à CORS_ORIGIN dans l'environnement Compose avant d'exposer l'application à un autre appareil :
CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080
Puis redémarrez :
docker compose -f docker-compose.dev.external-ollama.yml up -d
Commandes utiles
docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d
Dépannage
Le conteneur ne peut pas accéder à Ollama
docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version
Sous Linux, ajoutez :
extra_hosts:
- 'host.docker.internal:host-gateway'
Le modèle s'exécute sur le CPU
Ollama natif utilise l'installation de l'hôte. Vérifiez votre installation d'Ollama, le pilote du GPU et ollama ps.
Vous avez besoin de TTS
Suivez le guide du serveur Qwen3-TTS, Kyutai TTS ou LongCat AudioDiT, puis activez l'extension correspondante dans les paramètres.