Pular para o conteúdo principal

Trabalhar com modelos de IA

O Libre WebUI pode usar modelos locais do Ollama e modelos de nuvem fornecidos por plugins no mesmo workspace. O Gerenciador de modelos mostra modelos instalados do Ollama, modelos em execução, resultados ao vivo da Biblioteca do Ollama, entradas GGUF do Hugging Face e entradas do Ollama Cloud, quando disponíveis.

Escolher o primeiro modelo

Use estas opções como ponto de partida e depois troque de acordo com seu hardware e sua tarefa:

ModeloIndicado paraConfiguração típica
gemma4:12bChat geral rápido16 GB RAM ou 8 GB VRAM
qwen3.8:27bChat geral, programação e uso multilíngue32 GB RAM ou 16-24 GB VRAM
gemma4:26bChat avançado com a eficiência de MoE24 GB RAM ou 16 GB VRAM
gemma4:31bChat local denso com a melhor qualidade32 GB RAM ou 24 GB VRAM
nomic-embed-textEmbeddings de documentosModelo local pequeno de embedding

Modelos grandes, como os de 30B, 70B e MoE, podem ser excelentes, mas precisam de muito mais memória. Se você não tiver certeza, comece com um modelo pequeno e aumente depois que ele estiver funcionando sem problemas.

Gerenciador de modelos

Abra Configurações → Modelos para:

  • Baixar modelos do Ollama pelo nome.
  • Pesquisar na Biblioteca do Ollama ao vivo, em vez de depender de uma lista estática.
  • Ver os modelos instalados e em execução.
  • Atualizar todos os modelos do Ollama instalados em uma única operação.
  • Interromper ou descarregar modelos em execução.
  • Excluir modelos que você não usa mais.
  • Baixar modelos GGUF do Hugging Face por meio do Ollama, quando compatíveis.
  • Baixar modelos do Ollama Cloud usando o filtro de nuvem.

Para resultados do Ollama Cloud, a interface normaliza os nomes dos modelos de nuvem antes do download. Se um modelo exigir o sufixo :cloud ou -cloud, o Libre WebUI o aplicará por você no fluxo de modelos de nuvem.

Catálogo e visibilidade de modelos

O Catálogo de modelos, em Configurações → Padrões, lista todos os modelos de chat que você pode escolher, tanto locais quanto fornecidos por provedores, com um selo do provedor e uma caixa de pesquisa. Escolha o modelo padrão acima do catálogo para definir com qual modelo os novos chats começam.

Administradores podem marcar um modelo com estrela para fixá-lo no topo do catálogo e do menu de modelo padrão. Ao marcar vários modelos, o mais recente fica em primeiro lugar; ao remover a estrela, o modelo volta à sua posição manual ou de provedor.

Administradores têm mais um controle em cada linha: um botão de olho que oculta o modelo nos seletores de todas as outras pessoas. Ocultar reduz catálogos extensos aos modelos que o servidor realmente quer disponibilizar — é um refinamento da listagem, não um controle de autorização; portanto, trate-o como curadoria, não como limite de segurança. Administradores sempre veem a lista completa, com a indicação dos modelos ocultos.

Modelos locais ou na nuvem

ModoPontos fortesConcessões
Ollama localPrivado, offline após o download, custo previsívelDepende de CPU/GPU/RAM
Ollama CloudFluxo conhecido do Ollama sem limites do hardware localExige acesso à nuvem e à rede
Plugins de provedoresAcesso a modelos gerenciados de vários provedoresAplicam-se chaves de API, preços e políticas de privacidade do provedor

Você pode manter modelos locais para trabalhos privados e habilitar plugins de provedores para tarefas que exigem modelos hospedados maiores.

Modelo de visão padrão

Você pode conversar com um modelo de texto rápido e ainda assim enviar imagens. Escolha um modelo de visão em Configurações → Padrões → Modelos especializados → Modelo de visão; sempre que o contexto de saída do chat contiver imagens — um anexo novo, uma imagem anterior na sessão ou histórico em um chat anônimo —, esse turno será direcionado ao modelo de visão configurado, em vez do modelo da sessão. Turnos somente com texto continuam usando o modelo da sessão.

A configuração é individual por usuário, e o roteamento é automático e silencioso. Manter a opção Usar o modelo atual do chat desabilita o recurso. Observe que a verificação considera a presença de imagens, não os recursos do modelo da sessão: quando um modelo de visão está configurado, todo turno com imagens o utiliza, mesmo que o modelo da sessão também consiga processá-las.

A seleção armazena a identidade exata do provedor (Ollama ou um plugin específico) junto com o nome do modelo, portanto um provedor não pode capturar um modelo de mesmo nome. Se a seleção salva perder essa identidade — por exemplo, porque o modelo ou o provedor não está mais disponível —, um turno com imagem falhará. Selecione o modelo novamente em Configurações → Padrões → Modelos especializados → Modelo de visão para corrigir o problema. A falha explícita é deliberada; o Libre WebUI não substitui silenciosamente o provedor.

Modelos para o Work

O Work precisa de um modelo de chat capaz de chamar ferramentas. Ele pode usar:

  • Um modelo instalado do Ollama que anuncie o recurso tools.
  • Um modelo do Ollama Cloud disponível pelo endpoint Ollama configurado.
  • Um modelo listado por um plugin ativo de chat ou conclusão, com credenciais configuradas para o administrador atual.

As execuções do Work fornecidas por plugins usam o adaptador de provedor adequado ao plugin configurado: compatível com OpenAI, Anthropic ou Gemini. O Libre WebUI persiste o tipo exato de provedor e o identificador do plugin junto com a tarefa e cada execução, portanto um plugin não pode capturar um modelo Ollama de mesmo nome. Se o modelo ou o provedor selecionado rejeitar chamadas de ferramentas, a execução falhará em vez de mudar silenciosamente para outro provedor.

Com o Ollama local, as solicitações ao modelo permanecem na infraestrutura Ollama configurada. Com um modelo remoto, o provedor configurado recebe o prompt do sistema do Work, a conversa, as definições das ferramentas e seus resultados. Os resultados podem incluir texto-fonte, saída de comandos ou listagens de diretórios solicitadas pelo modelo. Os volumes do workspace e as credenciais do provedor permanecem no host do backend, mas o conteúdo de um arquivo pode sair desse host quando incluído no resultado de uma ferramenta.

Uma única execução autônoma do Work pode fazer várias chamadas ao modelo. Confira as políticas de preços, retenção e treinamento do provedor remoto antes de usar projetos confidenciais. O Libre WebUI mostra no Work um aviso sobre o provedor remoto, com controle de dispensa por usuário.

Guia de hardware

SistemaFaixa prática de modelosObservações
Somente CPU, 8-16 GB RAM1B-4BBom para chats leves e testes
8 GB VRAM4B-8B quantizadoPonto de partida confortável
12-16 GB VRAM8B-14B quantizadoBoa faixa para uso diário
24 GB VRAM14B-32B quantizadoEstação de trabalho local avançada
48 GB+ VRAM ou memória unificada grande32B-70B quantizadoExperimentação com modelos grandes

Modelos quantizados usam menos memória. Quantizações Q4 geralmente são o padrão mais prático; Q8 usa mais memória para oferecer melhor qualidade.

Recomendações por tarefa

TarefaDireção de modelo
Chat rápidogemma4:12b e outros modelos pequenos atuais
ProgramaçãoQwen Coder, Codestral e modelos de programação de provedores
RaciocínioModelos Qwen e Gemma maiores e modelos de raciocínio de provedores
VisãoModelos multimodais, como LLaVA, Qwen VL ou modelos de visão de provedores
Pesquisa em documentosnomic-embed-text ou outro modelo de embedding
Conversão de texto em falaPlugins TTS, como Qwen3-TTS ou Kyutai TTS

Os nomes dos modelos dos provedores mudam com frequência. No Libre WebUI, use a descoberta de modelos do provedor, quando disponível, ou cole o ID exato exibido no painel do provedor.

Prompts e configurações

  • Controles de geração, como temperatura, limites de tokens, tamanho do contexto e penalidades, ficam agrupados em Configurações avançadas de geração e permanecem fechados por padrão.
  • Use temperatura mais baixa (0.1-0.3) para respostas factuais e reproduzíveis.
  • Use temperatura média (0.5-0.7) para trabalhos comuns do assistente.
  • Use temperatura mais alta (0.8+) para brainstorming e escrita criativa.
  • Mantenha um tamanho de contexto razoável quando estiver próximo dos limites de memória.
  • Use personas quando quiser parâmetros persistentes de modelo e um prompt do sistema reutilizável.

Solução de problemas

Falha no download

  • Confirme que o Ollama está em execução: ollama list.
  • Tente o mesmo download em um terminal para ver o erro original do Ollama.
  • Verifique o espaço em disco antes de baixar modelos grandes.
  • Se estiver usando o filtro de nuvem do Gerenciador de modelos, deixe o Libre WebUI cuidar dos sufixos de nuvem.

Respostas lentas

  • Tente um modelo menor ou uma quantização mais baixa.
  • Use ollama ps para verificar o que está carregado.
  • Feche outros aplicativos que usam muito a GPU.
  • Reduza o tamanho do contexto.

Memória insuficiente

  • Troque Q8 por Q4.
  • Use um modelo 8B em vez de um 14B.
  • Mantenha carregado apenas o modelo necessário.
  • No Docker, confirme que o contêiner consegue acessar a GPU ou a instância Ollama do host.

Documentação relacionada