Aller au contenu principal

Pile GPU locale

Ce guide décrit la configuration GPU locale prise en charge par le dépôt : Ollama s'exécute nativement sur l'hôte pour accéder directement au GPU, tandis que Libre WebUI s'exécute dans Docker avec docker-compose.dev.external-ollama.yml.

Disponibilité de Work

Ollama s'exécute nativement sur le GPU de l'hôte. Work est activé grâce au socket Docker de l'hôte monté, ce qui permet à Libre WebUI de créer des conteneurs propres aux tâches sur le même démon. Il n'est pas nécessaire d'installer Libre WebUI nativement.

Le socket confère un contrôle de l'hôte Docker équivalent à celui de l'utilisateur root. Retirez son montage sauf si Work est nécessaire et, sous Linux, définissez DOCKER_GID dans .env.

Sur les machines à mémoire limitée, Work peut utiliser à la place un modèle Ollama Cloud ou une extension de complétion ou de chat distante configurée. Cela réduit la pression sur la mémoire du modèle local, mais Docker reste nécessaire pour l'espace de travail et les commandes de la tâche.

Ce que vous obtenez

  • Libre WebUI utilisant l'image librewebui/libre-webui:dev.
  • Ollama natif sur l'hôte pour l'inférence des modèles locaux.
  • Des volumes de données Libre WebUI persistants.
  • Une méthode simple pour tester l'image dev sans placer Ollama dans un conteneur.

Prérequis

ComposantPrérequis
DockerDocker Desktop ou Docker Engine avec Compose v2
OllamaInstallé et en cours d'exécution sur l'hôte
GPUFacultatif, mais recommandé pour les modèles locaux
NVIDIAPilote à jour et NVIDIA Container Toolkit si les tâches GPU sont conteneurisées
DisqueEspace suffisant pour les fichiers des modèles Ollama

Installer et vérifier Ollama

Linux :

curl -fsSL https://ollama.com/install.sh | sh

macOS :

brew install ollama
ollama serve

Téléchargez un premier modèle :

ollama pull gemma4:12b

Vérifiez l'API :

curl http://localhost:11434/api/version

Démarrer Libre WebUI

Depuis la racine du dépôt :

docker compose -f docker-compose.dev.external-ollama.yml up -d

Ouvrez http://localhost:8080.

Point de terminaison Ollama personnalisé

Si Ollama se trouve sur une autre machine :

OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Avec Tailscale :

OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Modèles recommandés

Pour une première station de travail dotée d'un GPU :

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Utilisez le gestionnaire de modèles pour découvrir de plus grands modèles une fois la pile de base opérationnelle.

Accès sur le réseau local

Ajoutez votre origine sur le réseau local ou Tailscale à CORS_ORIGIN dans l'environnement Compose avant d'exposer l'application à un autre appareil :

CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080

Puis redémarrez :

docker compose -f docker-compose.dev.external-ollama.yml up -d

Commandes utiles

docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d

Dépannage

Le conteneur ne peut pas accéder à Ollama

docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version

Sous Linux, ajoutez :

extra_hosts:
- 'host.docker.internal:host-gateway'

Le modèle s'exécute sur le CPU

Ollama natif utilise l'installation de l'hôte. Vérifiez votre installation d'Ollama, le pilote du GPU et ollama ps.

Vous avez besoin de TTS

Suivez le guide du serveur Qwen3-TTS, Kyutai TTS ou LongCat AudioDiT, puis activez l'extension correspondante dans les paramètres.

Documentation connexe