Stack GPU locale
Questa guida descrive la configurazione GPU locale supportata dal repository: Ollama viene eseguito in modo nativo sull'host per accedere direttamente alla GPU, mentre Libre WebUI viene eseguito in Docker con docker-compose.dev.external-ollama.yml.
Disponibilità di Work
Ollama viene eseguito in modo nativo sulla GPU dell'host. Work viene abilitato tramite il socket Docker dell'host montato, che consente a Libre WebUI di creare container specifici per le attività sullo stesso daemon. Non serve installare Libre WebUI in modo nativo.
Il socket concede un controllo dell'host Docker equivalente a quello di root. Rimuovi il relativo mount
se Work non serve e, su Linux, imposta DOCKER_GID in .env.
Sulle macchine con poca memoria, Work può invece usare un modello Ollama Cloud o un plugin remoto configurato per completamento/chat. Ciò riduce la pressione sulla memoria del modello locale, ma Docker rimane necessario per l'area di lavoro e i comandi dell'attività.
Che cosa offre
- Libre WebUI con l'immagine
librewebui/libre-webui:dev. - Ollama nativo sull'host per l'inferenza dei modelli locali.
- Volumi dati persistenti per Libre WebUI.
- Un percorso semplice per provare l'immagine dev senza eseguire Ollama in un container.
Prerequisiti
| Componente | Requisito |
|---|---|
| Docker | Docker Desktop o Docker Engine con Compose v2 |
| Ollama | Installato e in esecuzione sull'host |
| GPU | Facoltativa, ma consigliata per i modelli locali |
| NVIDIA | Driver aggiornato e NVIDIA Container Toolkit per i carichi GPU in container |
| Disco | Spazio sufficiente per i file dei modelli Ollama |
Installare e verificare Ollama
Linux:
curl -fsSL https://ollama.com/install.sh | sh
macOS:
brew install ollama
ollama serve
Scarica un modello iniziale:
ollama pull gemma4:12b
Verifica l'API:
curl http://localhost:11434/api/version
Avviare Libre WebUI
Dalla radice del repository:
docker compose -f docker-compose.dev.external-ollama.yml up -d
Apri http://localhost:8080.
Endpoint Ollama personalizzato
Se Ollama si trova su un'altra macchina:
OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Per Tailscale:
OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Modelli consigliati
Per iniziare con una workstation dotata di GPU:
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Usa il Gestore modelli per scoprire modelli più grandi dopo aver verificato il funzionamento dello stack di base.
Accesso LAN
Prima di esporre l'app a un altro dispositivo, aggiungi la tua origine LAN o Tailscale a CORS_ORIGIN nell'ambiente Compose:
CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080
Quindi riavvia:
docker compose -f docker-compose.dev.external-ollama.yml up -d
Comandi utili
docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d
Risoluzione dei problemi
Il container non riesce a raggiungere Ollama
docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version
Su Linux, aggiungi:
extra_hosts:
- 'host.docker.internal:host-gateway'
Il modello viene eseguito sulla CPU
Ollama nativo usa l'installazione dell'host. Controlla l'installazione di Ollama, il driver GPU e ollama ps.
Serve la sintesi vocale
Usa la guida al server Qwen3-TTS, Kyutai TTS o LongCat AudioDiT, quindi abilita il plugin corrispondente nelle Impostazioni.