Pila GPU local
Esta guía describe la configuración GPU local admitida por el repositorio: Ollama se ejecuta de forma nativa en el host para acceder directamente a la GPU, y Libre WebUI se ejecuta en Docker mediante docker-compose.dev.external-ollama.yml.
Disponibilidad de Work
Ollama se ejecuta de forma nativa en la GPU del host. Work se activa mediante el socket Docker montado y permite que Libre WebUI cree contenedores por tarea en el mismo daemon. No hace falta instalar Libre WebUI de forma nativa.
El socket concede control del host Docker equivalente a root. Retira el montaje si no necesitas Work
y define DOCKER_GID en .env en Linux.
En máquinas con poca memoria, Work puede usar un modelo Ollama Cloud o un plugin remoto de chat o completado. Reduce la presión de memoria local, pero Docker sigue siendo necesario para el espacio y los comandos.
Qué obtienes
- Libre WebUI con la imagen
librewebui/libre-webui:dev. - Ollama nativo para la inferencia local.
- Volúmenes persistentes de Libre WebUI.
- Una ruta limpia para probar la imagen dev sin contenerizar Ollama.
Requisitos previos
| Componente | Requisito |
|---|---|
| Docker | Docker Desktop o Docker Engine con Compose v2 |
| Ollama | Instalado y en ejecución en el host |
| GPU | Opcional, pero recomendado para modelos locales |
| NVIDIA | Controlador actual y NVIDIA Container Toolkit para cargas GPU en contenedores |
| Disco | Espacio suficiente para los modelos de Ollama |
Instalar y verificar Ollama
Linux:
curl -fsSL https://ollama.com/install.sh | sh
macOS:
brew install ollama
ollama serve
Descarga un modelo inicial:
ollama pull gemma4:12b
Verifica la API:
curl http://localhost:11434/api/version
Iniciar Libre WebUI
Desde la raíz del repositorio:
docker compose -f docker-compose.dev.external-ollama.yml up -d
Abre http://localhost:8080.
Endpoint de Ollama personalizado
Si Ollama está en otra máquina:
OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Con Tailscale:
OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Modelos recomendados
Para una primera workstation con GPU:
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Usa el Gestor de modelos para descubrir modelos mayores cuando la pila básica funcione.
Acceso LAN
Añade tu origen LAN o Tailscale a CORS_ORIGIN en el entorno Compose antes de exponer la aplicación:
CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080
Después reinicia:
docker compose -f docker-compose.dev.external-ollama.yml up -d
Comandos útiles
docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d
Solución de problemas
El contenedor no puede acceder a Ollama
docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version
En Linux, añade:
extra_hosts:
- 'host.docker.internal:host-gateway'
El modelo se ejecuta en CPU
Ollama nativo usa la instalación del host. Comprueba Ollama, el controlador de GPU y ollama ps.
Necesitas TTS
Usa las guías de Qwen3-TTS, Kyutai TTS o LongCat AudioDiT y activa después el plugin correspondiente.