Trabalhar com modelos de IA
O Libre WebUI pode usar modelos locais do Ollama e modelos de nuvem fornecidos por plugins no mesmo workspace. O Gerenciador de modelos mostra modelos instalados do Ollama, modelos em execução, resultados ao vivo da Biblioteca do Ollama, entradas GGUF do Hugging Face e entradas do Ollama Cloud, quando disponíveis.
Escolher o primeiro modelo
Use estas opções como ponto de partida e depois troque de acordo com seu hardware e sua tarefa:
| Modelo | Indicado para | Configuração típica |
|---|---|---|
gemma4:12b | Chat geral rápido | 16 GB RAM ou 8 GB VRAM |
qwen3.8:27b | Chat geral, programação e uso multilíngue | 32 GB RAM ou 16-24 GB VRAM |
gemma4:26b | Chat avançado com a eficiência de MoE | 24 GB RAM ou 16 GB VRAM |
gemma4:31b | Chat local denso com a melhor qualidade | 32 GB RAM ou 24 GB VRAM |
nomic-embed-text | Embeddings de documentos | Modelo local pequeno de embedding |
Modelos grandes, como os de 30B, 70B e MoE, podem ser excelentes, mas precisam de muito mais memória. Se você não tiver certeza, comece com um modelo pequeno e aumente depois que ele estiver funcionando sem problemas.
Gerenciador de modelos
Abra Configurações → Modelos para:
- Baixar modelos do Ollama pelo nome.
- Pesquisar na Biblioteca do Ollama ao vivo, em vez de depender de uma lista estática.
- Ver os modelos instalados e em execução.
- Atualizar todos os modelos do Ollama instalados em uma única operação.
- Interromper ou descarregar modelos em execução.
- Excluir modelos que você não usa mais.
- Baixar modelos GGUF do Hugging Face por meio do Ollama, quando compatíveis.
- Baixar modelos do Ollama Cloud usando o filtro de nuvem.
Para resultados do Ollama Cloud, a interface normaliza os nomes dos modelos de nuvem antes do download. Se um modelo exigir o sufixo :cloud ou -cloud, o Libre WebUI o aplicará por você no fluxo de modelos de nuvem.
Catálogo e visibilidade de modelos
O Catálogo de modelos, em Configurações → Padrões, lista todos os modelos de chat que você pode escolher, tanto locais quanto fornecidos por provedores, com um selo do provedor e uma caixa de pesquisa. Escolha o modelo padrão acima do catálogo para definir com qual modelo os novos chats começam.
Administradores podem marcar um modelo com estrela para fixá-lo no topo do catálogo e do menu de modelo padrão. Ao marcar vários modelos, o mais recente fica em primeiro lugar; ao remover a estrela, o modelo volta à sua posição manual ou de provedor.
Administradores têm mais um controle em cada linha: um botão de olho que oculta o modelo nos seletores de todas as outras pessoas. Ocultar reduz catálogos extensos aos modelos que o servidor realmente quer disponibilizar — é um refinamento da listagem, não um controle de autorização; portanto, trate-o como curadoria, não como limite de segurança. Administradores sempre veem a lista completa, com a indicação dos modelos ocultos.
Modelos locais ou na nuvem
| Modo | Pontos fortes | Concessões |
|---|---|---|
| Ollama local | Privado, offline após o download, custo previsível | Depende de CPU/GPU/RAM |
| Ollama Cloud | Fluxo conhecido do Ollama sem limites do hardware local | Exige acesso à nuvem e à rede |
| Plugins de provedores | Acesso a modelos gerenciados de vários provedores | Aplicam-se chaves de API, preços e políticas de privacidade do provedor |
Você pode manter modelos locais para trabalhos privados e habilitar plugins de provedores para tarefas que exigem modelos hospedados maiores.
Modelo de visão padrão
Você pode conversar com um modelo de texto rápido e ainda assim enviar imagens. Escolha um modelo de visão em Configurações → Padrões → Modelos especializados → Modelo de visão; sempre que o contexto de saída do chat contiver imagens — um anexo novo, uma imagem anterior na sessão ou histórico em um chat anônimo —, esse turno será direcionado ao modelo de visão configurado, em vez do modelo da sessão. Turnos somente com texto continuam usando o modelo da sessão.
A configuração é individual por usuário, e o roteamento é automático e silencioso. Manter a opção Usar o modelo atual do chat desabilita o recurso. Observe que a verificação considera a presença de imagens, não os recursos do modelo da sessão: quando um modelo de visão está configurado, todo turno com imagens o utiliza, mesmo que o modelo da sessão também consiga processá-las.
A seleção armazena a identidade exata do provedor (Ollama ou um plugin específico) junto com o nome do modelo, portanto um provedor não pode capturar um modelo de mesmo nome. Se a seleção salva perder essa identidade — por exemplo, porque o modelo ou o provedor não está mais disponível —, um turno com imagem falhará. Selecione o modelo novamente em Configurações → Padrões → Modelos especializados → Modelo de visão para corrigir o problema. A falha explícita é deliberada; o Libre WebUI não substitui silenciosamente o provedor.
Modelos para o Work
O Work precisa de um modelo de chat capaz de chamar ferramentas. Ele pode usar:
- Um modelo instalado do Ollama que anuncie o recurso
tools. - Um modelo do Ollama Cloud disponível pelo endpoint Ollama configurado.
- Um modelo listado por um plugin ativo de chat ou conclusão, com credenciais configuradas para o administrador atual.
As execuções do Work fornecidas por plugins usam o adaptador de provedor adequado ao plugin configurado: compatível com OpenAI, Anthropic ou Gemini. O Libre WebUI persiste o tipo exato de provedor e o identificador do plugin junto com a tarefa e cada execução, portanto um plugin não pode capturar um modelo Ollama de mesmo nome. Se o modelo ou o provedor selecionado rejeitar chamadas de ferramentas, a execução falhará em vez de mudar silenciosamente para outro provedor.
Com o Ollama local, as solicitações ao modelo permanecem na infraestrutura Ollama configurada. Com um modelo remoto, o provedor configurado recebe o prompt do sistema do Work, a conversa, as definições das ferramentas e seus resultados. Os resultados podem incluir texto-fonte, saída de comandos ou listagens de diretórios solicitadas pelo modelo. Os volumes do workspace e as credenciais do provedor permanecem no host do backend, mas o conteúdo de um arquivo pode sair desse host quando incluído no resultado de uma ferramenta.
Uma única execução autônoma do Work pode fazer várias chamadas ao modelo. Confira as políticas de preços, retenção e treinamento do provedor remoto antes de usar projetos confidenciais. O Libre WebUI mostra no Work um aviso sobre o provedor remoto, com controle de dispensa por usuário.
Guia de hardware
| Sistema | Faixa prática de modelos | Observações |
|---|---|---|
| Somente CPU, 8-16 GB RAM | 1B-4B | Bom para chats leves e testes |
| 8 GB VRAM | 4B-8B quantizado | Ponto de partida confortável |
| 12-16 GB VRAM | 8B-14B quantizado | Boa faixa para uso diário |
| 24 GB VRAM | 14B-32B quantizado | Estação de trabalho local avançada |
| 48 GB+ VRAM ou memória unificada grande | 32B-70B quantizado | Experimentação com modelos grandes |
Modelos quantizados usam menos memória. Quantizações Q4 geralmente são o padrão mais prático; Q8 usa mais memória para oferecer melhor qualidade.
Recomendações por tarefa
| Tarefa | Direção de modelo |
|---|---|
| Chat rápido | gemma4:12b e outros modelos pequenos atuais |
| Programação | Qwen Coder, Codestral e modelos de programação de provedores |
| Raciocínio | Modelos Qwen e Gemma maiores e modelos de raciocínio de provedores |
| Visão | Modelos multimodais, como LLaVA, Qwen VL ou modelos de visão de provedores |
| Pesquisa em documentos | nomic-embed-text ou outro modelo de embedding |
| Conversão de texto em fala | Plugins TTS, como Qwen3-TTS ou Kyutai TTS |
Os nomes dos modelos dos provedores mudam com frequência. No Libre WebUI, use a descoberta de modelos do provedor, quando disponível, ou cole o ID exato exibido no painel do provedor.
Prompts e configurações
- Controles de geração, como temperatura, limites de tokens, tamanho do contexto e penalidades, ficam agrupados em Configurações avançadas de geração e permanecem fechados por padrão.
- Use temperatura mais baixa (
0.1-0.3) para respostas factuais e reproduzíveis. - Use temperatura média (
0.5-0.7) para trabalhos comuns do assistente. - Use temperatura mais alta (
0.8+) para brainstorming e escrita criativa. - Mantenha um tamanho de contexto razoável quando estiver próximo dos limites de memória.
- Use personas quando quiser parâmetros persistentes de modelo e um prompt do sistema reutilizável.
Solução de problemas
Falha no download
- Confirme que o Ollama está em execução:
ollama list. - Tente o mesmo download em um terminal para ver o erro original do Ollama.
- Verifique o espaço em disco antes de baixar modelos grandes.
- Se estiver usando o filtro de nuvem do Gerenciador de modelos, deixe o Libre WebUI cuidar dos sufixos de nuvem.
Respostas lentas
- Tente um modelo menor ou uma quantização mais baixa.
- Use
ollama pspara verificar o que está carregado. - Feche outros aplicativos que usam muito a GPU.
- Reduza o tamanho do contexto.
Memória insuficiente
- Troque Q8 por Q4.
- Use um modelo 8B em vez de um 14B.
- Mantenha carregado apenas o modelo necessário.
- No Docker, confirme que o contêiner consegue acessar a GPU ou a instância Ollama do host.