Passa al contenuto principale

Stack GPU locale

Questa guida descrive la configurazione GPU locale supportata dal repository: Ollama viene eseguito in modo nativo sull'host per accedere direttamente alla GPU, mentre Libre WebUI viene eseguito in Docker con docker-compose.dev.external-ollama.yml.

Disponibilità di Work

Ollama viene eseguito in modo nativo sulla GPU dell'host. Work viene abilitato tramite il socket Docker dell'host montato, che consente a Libre WebUI di creare container specifici per le attività sullo stesso daemon. Non serve installare Libre WebUI in modo nativo.

Il socket concede un controllo dell'host Docker equivalente a quello di root. Rimuovi il relativo mount se Work non serve e, su Linux, imposta DOCKER_GID in .env.

Sulle macchine con poca memoria, Work può invece usare un modello Ollama Cloud o un plugin remoto configurato per completamento/chat. Ciò riduce la pressione sulla memoria del modello locale, ma Docker rimane necessario per l'area di lavoro e i comandi dell'attività.

Che cosa offre

  • Libre WebUI con l'immagine librewebui/libre-webui:dev.
  • Ollama nativo sull'host per l'inferenza dei modelli locali.
  • Volumi dati persistenti per Libre WebUI.
  • Un percorso semplice per provare l'immagine dev senza eseguire Ollama in un container.

Prerequisiti

ComponenteRequisito
DockerDocker Desktop o Docker Engine con Compose v2
OllamaInstallato e in esecuzione sull'host
GPUFacoltativa, ma consigliata per i modelli locali
NVIDIADriver aggiornato e NVIDIA Container Toolkit per i carichi GPU in container
DiscoSpazio sufficiente per i file dei modelli Ollama

Installare e verificare Ollama

Linux:

curl -fsSL https://ollama.com/install.sh | sh

macOS:

brew install ollama
ollama serve

Scarica un modello iniziale:

ollama pull gemma4:12b

Verifica l'API:

curl http://localhost:11434/api/version

Avviare Libre WebUI

Dalla radice del repository:

docker compose -f docker-compose.dev.external-ollama.yml up -d

Apri http://localhost:8080.

Endpoint Ollama personalizzato

Se Ollama si trova su un'altra macchina:

OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Per Tailscale:

OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Modelli consigliati

Per iniziare con una workstation dotata di GPU:

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Usa il Gestore modelli per scoprire modelli più grandi dopo aver verificato il funzionamento dello stack di base.

Accesso LAN

Prima di esporre l'app a un altro dispositivo, aggiungi la tua origine LAN o Tailscale a CORS_ORIGIN nell'ambiente Compose:

CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080

Quindi riavvia:

docker compose -f docker-compose.dev.external-ollama.yml up -d

Comandi utili

docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d

Risoluzione dei problemi

Il container non riesce a raggiungere Ollama

docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version

Su Linux, aggiungi:

extra_hosts:
- 'host.docker.internal:host-gateway'

Il modello viene eseguito sulla CPU

Ollama nativo usa l'installazione dell'host. Controlla l'installazione di Ollama, il driver GPU e ollama ps.

Serve la sintesi vocale

Usa la guida al server Qwen3-TTS, Kyutai TTS o LongCat AudioDiT, quindi abilita il plugin corrispondente nelle Impostazioni.

Documenti correlati