Pilha de GPU local
Este guia descreve a configuração de GPU local compatível com o repositório: o Ollama é executado nativamente no host para ter acesso direto à GPU, e o Libre WebUI é executado no Docker com docker-compose.dev.external-ollama.yml.
Disponibilidade do Work
O Ollama é executado nativamente na GPU do host. O Work é ativado pelo socket Docker montado do host, permitindo que o Libre WebUI crie contêineres limitados às tarefas no mesmo daemon. Não é necessária uma instalação nativa do Libre WebUI.
O socket concede controle equivalente ao root do host Docker. Remova sua montagem
se o Work não for necessário e, no Linux, defina DOCKER_GID em .env.
Em máquinas com pouca memória, o Work pode usar um modelo do Ollama Cloud ou um plugin configurado remoto de conclusão/chat. Isso reduz a pressão sobre a memória do modelo local, mas o Docker continua obrigatório para o espaço de trabalho e os comandos da tarefa.
O que você terá
- Libre WebUI usando a imagem
librewebui/libre-webui:dev. - Ollama nativo no host para inferência de modelos locais.
- Volumes de dados persistentes do Libre WebUI.
- Um caminho simples para testar a imagem dev sem colocar o Ollama em um contêiner.
Pré-requisitos
| Componente | Requisito |
|---|---|
| Docker | Docker Desktop ou Docker Engine com Compose v2 |
| Ollama | Instalado e em execução no host |
| GPU | Opcional, mas recomendada para modelos locais |
| NVIDIA | Driver atual e NVIDIA Container Toolkit se você usar cargas de GPU em contêineres |
| Disco | Espaço suficiente para os arquivos de modelos do Ollama |
Instale e verifique o Ollama
Linux:
curl -fsSL https://ollama.com/install.sh | sh
macOS:
brew install ollama
ollama serve
Baixe um modelo inicial:
ollama pull gemma4:12b
Verifique a API:
curl http://localhost:11434/api/version
Inicie o Libre WebUI
A partir da raiz do repositório:
docker compose -f docker-compose.dev.external-ollama.yml up -d
Abra http://localhost:8080.
Endpoint personalizado do Ollama
Se o Ollama estiver em outra máquina:
OLLAMA_BASE_URL=http://192.168.1.100:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Para Tailscale:
OLLAMA_BASE_URL=http://100.x.y.z:11434 docker compose -f docker-compose.dev.external-ollama.yml up -d
Modelos recomendados
Para uma primeira workstation com GPU:
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Use o Gerenciador de modelos para descobrir modelos maiores depois que a pilha básica estiver funcionando.
Acesso pela LAN
Adicione sua origem da LAN ou do Tailscale a CORS_ORIGIN no ambiente do Compose antes de expor o aplicativo a outro dispositivo:
CORS_ORIGIN=http://localhost:8080,http://192.168.1.50:8080
Depois, reinicie:
docker compose -f docker-compose.dev.external-ollama.yml up -d
Comandos úteis
docker compose -f docker-compose.dev.external-ollama.yml ps
docker compose -f docker-compose.dev.external-ollama.yml logs -f libre-webui
docker compose -f docker-compose.dev.external-ollama.yml pull
docker compose -f docker-compose.dev.external-ollama.yml up -d
Solução de problemas
O contêiner não consegue acessar o Ollama
docker compose -f docker-compose.dev.external-ollama.yml exec libre-webui \
wget -O- http://host.docker.internal:11434/api/version
No Linux, adicione:
extra_hosts:
- 'host.docker.internal:host-gateway'
O modelo é executado na CPU
O Ollama nativo usa a instalação do host. Verifique a instalação do Ollama, o driver da GPU e ollama ps.
Precisa de TTS
Use o guia do servidor Qwen3-TTS, Kyutai TTS ou LongCat AudioDiT e ative o plugin correspondente nas Configurações.