Pular para o conteúdo principal

Requisitos de hardware

A interface normal de Chat do Libre WebUI é leve. A maior parte da demanda por recursos vem dos modelos locais do Ollama; as tarefas do Work baseadas em contêineres adicionam um orçamento separado de CPU, memória, processos, imagens e armazenamento de projetos.

Referência rápida

HardwareModelos locais viáveisObservações
8 GB de RAM, somente CPU1B-4B quantizadosBom para testes e conversas leves
16 GB de RAM, somente CPU4B-8B quantizadosUtilizável, mais lento que GPU
8 GB de VRAM4B-8B quantizadosBoa configuração local cotidiana
12-16 GB de VRAM8B-14B quantizadosFaixa de workstation potente
24 GB de VRAM14B-32B quantizadosUso local de alto desempenho
48 GB+ de VRAM ou muita memória unificada32B-70B quantizadosExperimentação com modelos grandes

A velocidade real depende da arquitetura do modelo, quantização, tamanho do contexto, drivers da GPU e dos outros processos em execução.

Bons modelos para começar

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Use nomic-embed-text para embeddings de documentos, e não como modelo de chat.

VRAM e RAM

A VRAM é o fator mais importante para a velocidade de modelos locais. Se o modelo couber na VRAM, as respostas serão muito mais rápidas. Se parte dele passar para a RAM do sistema, ainda poderá funcionar, mas será mais lento.

A RAM do sistema é importante para inferência na CPU, transferência parcial para GPU, janelas de contexto longas e execução do restante do aplicativo.

Apple Silicon

O Apple Silicon usa memória unificada; portanto, a memória do modelo vem do mesmo conjunto usado pelo sistema operacional e pelos aplicativos. Máquinas com mais memória unificada podem executar modelos quantizados maiores do que o número de VRAM de sua GPU sugeriria em um sistema com GPU dedicada.

Mantenha memória livre suficiente para o navegador, o backend e o sistema operacional.

NVIDIA

Em geral, as GPUs NVIDIA oferecem a melhor compatibilidade com inferência local por meio de CUDA. Use drivers atuais e confirme o acesso do Docker à GPU ao executar o Ollama em contêineres.

AMD e Intel

O suporte a AMD e Intel depende do Ollama e dos drivers disponíveis para sua plataforma. A inferência na CPU continua disponível quando não há aceleração por GPU.

Como reduzir o uso de memória

  • Use modelos menores.
  • Use quantização Q4 em vez de Q8.
  • Reduza o tamanho do contexto.
  • Descarregue os modelos que não estiver usando.
  • Mantenha os embeddings de documentos separados da escolha do modelo de chat.

Capacidade do ambiente de execução do Work

O Work acrescenta recursos de contêiner além da WebUI e do processo do modelo. Por padrão, cada contêiner de tarefa ativo tem:

  • 2 GB de memória;
  • 2 CPUs; e
  • 256 processos.

Por padrão, o backend permite duas tarefas ativas baseadas em contêineres em toda a instância e uma por administrador. Esses valores são limites, não reservas, mas os operadores devem dimensionar recursos para o backend da WebUI, o navegador, o Docker, o Ollama e o contêiner da tarefa ao mesmo tempo. No Apple Silicon, todos eles disputam, em última análise, o mesmo conjunto de memória unificada.

Usar o Ollama Cloud ou um plugin configurado de modelo remoto pode evitar o carregamento de um modelo grande na RAM ou VRAM local. Isso não elimina a exigência do Docker nem os recursos necessários ao contêiner do Work.

Cada tarefa do Work também possui um volume nomeado do Docker para arquivos gerados e dependências locais. Atualmente, os volumes não têm cotas de disco por tarefa; portanto, a instalação de pacotes ou projetos gerados pode esgotar o armazenamento do Docker. Monitore a raiz de dados do Docker, defina limites no host quando disponíveis e faça backup dos volumes das tarefas separadamente do banco de dados do Libre WebUI.

Ajuste as configurações WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT e WORK_MAX_ACTIVE_RUNTIMES_* somente depois de medir o host do backend. Consulte a referência de variáveis de ambiente para conhecer os valores padrão.

Documentação relacionada