Saltar al contenido principal

Pila GPU local

Esta guía describe la configuración GPU local admitida por el repositorio: Ollama se ejecuta de forma nativa en el host para acceder directamente a la GPU, y Libre WebUI se ejecuta en Docker mediante docker-compose.dev.external-ollama.yml.

Disponibilidad de Work

Ollama se ejecuta de forma nativa en la GPU del host. Work se activa mediante el socket Docker montado y permite que Libre WebUI cree contenedores por tarea en el mismo daemon. No hace falta instalar Libre WebUI de forma nativa.

El socket concede control del host Docker equivalente a root. Retira el montaje si no necesitas Work y define DOCKER_GID en .env en Linux.

En máquinas con poca memoria, Work puede usar un modelo Ollama Cloud o un plugin remoto de chat o completado. Reduce la presión de memoria local, pero Docker sigue siendo necesario para el espacio y los comandos.

Qué obtienes

  • Libre WebUI con la imagen librewebui/libre-webui:dev.
  • Ollama nativo para la inferencia local.
  • Volúmenes persistentes de Libre WebUI.
  • Una ruta limpia para probar la imagen dev sin contenerizar Ollama.

Requisitos previos

ComponenteRequisito
DockerDocker Desktop o Docker Engine con Compose v2
OllamaInstalado y en ejecución en el host
GPUOpcional, pero recomendado para modelos locales
NVIDIAControlador actual y NVIDIA Container Toolkit para cargas GPU en contenedores
DiscoEspacio suficiente para los modelos de Ollama

Instalar y verificar Ollama

Linux:

curl -fsSL https://ollama.com/install.sh | sh

macOS:

brew install ollama
ollama serve

Descarga un modelo inicial:

ollama pull gemma4:12b

Verifica la API:

curl http://localhost:11434/api/version

Iniciar Libre WebUI

Desde la raíz del repositorio:

docker compose -f docker-compose.dev.external-ollama.yml up -d

Abre http://localhost:8080.

Endpoint de Ollama personalizado

Si Ollama está en otra máquina:

OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Con Tailscale:

OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Modelos recomendados

Para una primera workstation con GPU:

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Usa el Gestor de modelos para descubrir modelos mayores cuando la pila básica funcione.

Acceso LAN

Añade tu origen LAN o Tailscale a CORS_ORIGIN en el entorno Compose antes de exponer la aplicación:

CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080

Después reinicia:

docker compose -f docker-compose.dev.external-ollama.yml up -d

Comandos útiles

docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d

Solución de problemas

El contenedor no puede acceder a Ollama

docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version

En Linux, añade:

extra_hosts:
- 'host.docker.internal:host-gateway'

El modelo se ejecuta en CPU

Ollama nativo usa la instalación del host. Comprueba Ollama, el controlador de GPU y ollama ps.

Necesitas TTS

Usa las guías de Qwen3-TTS, Kyutai TTS o LongCat AudioDiT y activa después el plugin correspondiente.

Documentación relacionada