Requisitos de hardware
A interface normal de Chat do Libre WebUI é leve. A maior parte da demanda por recursos vem dos modelos locais do Ollama; as tarefas do Work baseadas em contêineres adicionam um orçamento separado de CPU, memória, processos, imagens e armazenamento de projetos.
Referência rápida
| Hardware | Modelos locais viáveis | Observações |
|---|---|---|
| 8 GB de RAM, somente CPU | 1B-4B quantizados | Bom para testes e conversas leves |
| 16 GB de RAM, somente CPU | 4B-8B quantizados | Utilizável, mais lento que GPU |
| 8 GB de VRAM | 4B-8B quantizados | Boa configuração local cotidiana |
| 12-16 GB de VRAM | 8B-14B quantizados | Faixa de workstation potente |
| 24 GB de VRAM | 14B-32B quantizados | Uso local de alto desempenho |
| 48 GB+ de VRAM ou muita memória unificada | 32B-70B quantizados | Experimentação com modelos grandes |
A velocidade real depende da arquitetura do modelo, quantização, tamanho do contexto, drivers da GPU e dos outros processos em execução.
Bons modelos para começar
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Use nomic-embed-text para embeddings de documentos, e não como modelo de chat.
VRAM e RAM
A VRAM é o fator mais importante para a velocidade de modelos locais. Se o modelo couber na VRAM, as respostas serão muito mais rápidas. Se parte dele passar para a RAM do sistema, ainda poderá funcionar, mas será mais lento.
A RAM do sistema é importante para inferência na CPU, transferência parcial para GPU, janelas de contexto longas e execução do restante do aplicativo.
Apple Silicon
O Apple Silicon usa memória unificada; portanto, a memória do modelo vem do mesmo conjunto usado pelo sistema operacional e pelos aplicativos. Máquinas com mais memória unificada podem executar modelos quantizados maiores do que o número de VRAM de sua GPU sugeriria em um sistema com GPU dedicada.
Mantenha memória livre suficiente para o navegador, o backend e o sistema operacional.
NVIDIA
Em geral, as GPUs NVIDIA oferecem a melhor compatibilidade com inferência local por meio de CUDA. Use drivers atuais e confirme o acesso do Docker à GPU ao executar o Ollama em contêineres.
AMD e Intel
O suporte a AMD e Intel depende do Ollama e dos drivers disponíveis para sua plataforma. A inferência na CPU continua disponível quando não há aceleração por GPU.
Como reduzir o uso de memória
- Use modelos menores.
- Use quantização Q4 em vez de Q8.
- Reduza o tamanho do contexto.
- Descarregue os modelos que não estiver usando.
- Mantenha os embeddings de documentos separados da escolha do modelo de chat.
Capacidade do ambiente de execução do Work
O Work acrescenta recursos de contêiner além da WebUI e do processo do modelo. Por padrão, cada contêiner de tarefa ativo tem:
- 2 GB de memória;
- 2 CPUs; e
- 256 processos.
Por padrão, o backend permite duas tarefas ativas baseadas em contêineres em toda a instância e uma por administrador. Esses valores são limites, não reservas, mas os operadores devem dimensionar recursos para o backend da WebUI, o navegador, o Docker, o Ollama e o contêiner da tarefa ao mesmo tempo. No Apple Silicon, todos eles disputam, em última análise, o mesmo conjunto de memória unificada.
Usar o Ollama Cloud ou um plugin configurado de modelo remoto pode evitar o carregamento de um modelo grande na RAM ou VRAM local. Isso não elimina a exigência do Docker nem os recursos necessários ao contêiner do Work.
Cada tarefa do Work também possui um volume nomeado do Docker para arquivos gerados e dependências locais. Atualmente, os volumes não têm cotas de disco por tarefa; portanto, a instalação de pacotes ou projetos gerados pode esgotar o armazenamento do Docker. Monitore a raiz de dados do Docker, defina limites no host quando disponíveis e faça backup dos volumes das tarefas separadamente do banco de dados do Libre WebUI.
Ajuste as configurações WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT e
WORK_MAX_ACTIVE_RUNTIMES_* somente depois de medir o host do backend. Consulte
a referência de variáveis de ambiente para conhecer os valores padrão.