Pular para o conteúdo principal

Pilha de GPU local

Este guia descreve a configuração de GPU local compatível com o repositório: o Ollama é executado nativamente no host para ter acesso direto à GPU, e o Libre WebUI é executado no Docker com docker-compose.dev.external-ollama.yml.

Disponibilidade do Work

O Ollama é executado nativamente na GPU do host. O Work é ativado pelo socket Docker montado do host, permitindo que o Libre WebUI crie contêineres limitados às tarefas no mesmo daemon. Não é necessária uma instalação nativa do Libre WebUI.

O socket concede controle equivalente ao root do host Docker. Remova sua montagem se o Work não for necessário e, no Linux, defina DOCKER_GID em .env.

Em máquinas com pouca memória, o Work pode usar um modelo do Ollama Cloud ou um plugin configurado remoto de conclusão/chat. Isso reduz a pressão sobre a memória do modelo local, mas o Docker continua obrigatório para o espaço de trabalho e os comandos da tarefa.

O que você terá

  • Libre WebUI usando a imagem librewebui/libre-webui:dev.
  • Ollama nativo no host para inferência de modelos locais.
  • Volumes de dados persistentes do Libre WebUI.
  • Um caminho simples para testar a imagem dev sem colocar o Ollama em um contêiner.

Pré-requisitos

ComponenteRequisito
DockerDocker Desktop ou Docker Engine com Compose v2
OllamaInstalado e em execução no host
GPUOpcional, mas recomendada para modelos locais
NVIDIADriver atual e NVIDIA Container Toolkit se você usar cargas de GPU em contêineres
DiscoEspaço suficiente para os arquivos de modelos do Ollama

Instale e verifique o Ollama

Linux:

curl -fsSL https://ollama.com/install.sh | sh

macOS:

brew install ollama
ollama serve

Baixe um modelo inicial:

ollama pull gemma4:12b

Verifique a API:

curl http://localhost:11434/api/version

Inicie o Libre WebUI

A partir da raiz do repositório:

docker compose -f docker-compose.dev.external-ollama.yml up -d

Abra http://localhost:8080.

Endpoint personalizado do Ollama

Se o Ollama estiver em outra máquina:

OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Para Tailscale:

OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d

Modelos recomendados

Para uma primeira workstation com GPU:

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Use o Gerenciador de modelos para descobrir modelos maiores depois que a pilha básica estiver funcionando.

Acesso pela LAN

Adicione sua origem da LAN ou do Tailscale a CORS_ORIGIN no ambiente do Compose antes de expor o aplicativo a outro dispositivo:

CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080

Depois, reinicie:

docker compose -f docker-compose.dev.external-ollama.yml up -d

Comandos úteis

docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d

Solução de problemas

O contêiner não consegue acessar o Ollama

docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version

No Linux, adicione:

extra_hosts:
- 'host.docker.internal:host-gateway'

O modelo é executado na CPU

O Ollama nativo usa a instalação do host. Verifique a instalação do Ollama, o driver da GPU e ollama ps.

Precisa de TTS

Use o guia do servidor Qwen3-TTS, Kyutai TTS ou LongCat AudioDiT e ative o plugin correspondente nas Configurações.

Documentação relacionada