Dicas avançadas
Esta página reúne fluxos de trabalho práticos que tornam o Libre WebUI mais rápido, organizado e confiável no uso diário.
Mantenha um modelo diário pequeno carregado
Use um modelo local rápido para tarefas rotineiras e mude para modelos maiores somente quando a tarefa exigir.
Bons exemplos para o uso cotidiano:
gemma4:12bpara conversas rápidas do dia a diaqwen3.8:27bpara tarefas gerais mais exigentesgemma4:26bpara eficiência MoE em hardware mais potentegemma4:31bpara obter a melhor qualidade local com modelo densonomic-embed-textpara embeddings de documentos
Abra Modelos para ver quais modelos estão em execução. Descarregue os modelos que não estiver usando quando a VRAM estiver apertada.
Use conversas anônimas para conversas que não devem persistir
Inicie uma conversa anônima pelo menu + da barra de abas, pela paleta de comandos, pela
página inicial ou pelo botão de fantasma na tela de boas-vindas do chat. Ela também tem uma
URL direta: /chat?incognito=1.
Uma conversa anônima nunca persiste: nenhuma sessão é criada no servidor, nenhuma mensagem é salva e ela nunca aparece na barra lateral nem no histórico. A conversa mostra o aviso Modo privado ("Esta conversa não será salva"). Abrir uma conversa salva encerra o modo anônimo; recarregar uma aba anônima inicia uma nova conversa privada vazia, de modo que as interações anteriores desaparecem.
Entenda o limite com clareza: o modo anônimo controla a persistência, e não a exposição ao provedor. O modelo selecionado — local ou remoto — ainda recebe a conversa completa, e o contexto de documentos continua sendo aplicado quando ativado. Para uma conversa que não possa sair da sua infraestrutura, combine o modo anônimo com um modelo Ollama local.
Gerencie as abas pelo menu de contexto
Clique com o botão direito em uma aba (ou pressione Shift + F10 com a aba em foco) para:
- Fechar aba
- Fechar outras abas
- Fechar abas à direita
- Fechar todas as abas
Início é sempre a primeira aba e não pode ser fechada. Os administradores também recebem
entradas diretas para Gerenciamento de usuários, Sistema e Uso dos provedores no
menu + — e podem fixar qualquer uma das três no rodapé da barra lateral (ao lado de
Configurações) usando o ícone de alfinete no menu do avatar, sem precisar abrir o menu
novamente.
Navegue rapidamente com a paleta de comandos
Cmd/Ctrl + K abre a paleta de comandos em qualquer lugar — inclusive quando o
campo de composição está em foco. Ela faz correspondência aproximada entre ações do aplicativo, suas conversas e suas
tarefas do Work; assim, consultas parciais ou com erros ainda funcionam: autmtn encontra
Automações, "pictures" encontra Imagine, "dark" encontra a opção de tema.
A partir de três caracteres, ela também pesquisa no conteúdo de mensagens, notas e documentos
(inclusive notas compartilhadas com você) e mostra um trecho para cada resultado —
isso ocorre na memória sobre seus próprios dados descriptografados; nada é indexado em
texto simples no disco. Os caracteres correspondentes ficam destacados,
os resultados são classificados por relevância e, sem consulta, você vê suas conversas e tarefas
mais recentes. Navegue com ↑/↓, abra com Enter e feche com Esc
(ou Cmd/Ctrl + K novamente).
Tema padrão
Novas instalações usam o tema escuro, aplicado antes da primeira renderização para evitar
um clarão branco. Um administrador pode alterar o padrão de toda a instância em
Configurações > Gerenciamento de Usuários > Tema padrão (Claro, Escuro ou Preto Puro). Esse padrão pinta a
página de login, define o valor inicial de cada nova conta e vale em qualquer navegador que
ainda não tenha escolhido um tema; uma preferência pessoal salva sempre é respeitada. O Libre
WebUI não acompanha a configuração de tema do sistema operacional; alterne explicitamente com
Cmd/Ctrl + D, pelo botão de sol/lua ou pelas Configurações. O botão alterna entre Claro,
Escuro, Preto Puro e Celestial.
O tema Celestial acompanha o sol: a paleta e um céu ao vivo (o sol ou a lua em seu arco, nuvens, estrelas depois do anoitecer e uma luz que segue o ponteiro à noite) mudam minuto a minuto, com o nascer e o pôr do sol se deslocando ao longo do ano. Escolha-o em Configurações > Aparência; ali, um controle deslizante de Hora do dia mostra qualquer minuto do dia, e Seguir o relógio volta ao horário real. Sem uma localização, ele assume um dia de latitude média; compartilhe sua localização (ou digite as coordenadas) e o nascer e o pôr do sol passam a ser calculados para o seu céu real. A localização é arredondada para cerca de um quilômetro, fica apenas naquele navegador e nunca é enviada ao servidor. Com uma localização você também pode ativar Acompanhar o clima: as condições atuais vêm direto do Open-Meteo para o seu navegador, e nuvens, chuva, neve, neblina e vento moldam o céu.
Mantenha as tarefas do Work focadas
Use uma tarefa do Work separada para cada projeto ou objetivo independente. Cada tarefa tem sua própria conversa, identidade de contêiner gerenciada e arquivos persistentes. O contêiner pode parar ou ser recriado, mas seu volume nomeado sobrevive; portanto, reutilizar a mesma tarefa preserva o contexto útil, enquanto iniciar uma nova tarefa cria uma separação limpa.
Uma boa instrução inicial informa ao modelo:
- O resultado desejado.
- Restrições técnicas ou de design importantes.
- O comando ou comportamento que deve verificar a conclusão.
- Arquivos ou interfaces que devem permanecer inalterados.
Acompanhe o progresso em Atividade e, depois, examine e teste o resultado em Arquivos,
Git, Terminal e Visualização. O editor de arquivos oferece realce de sintaxe nos temas claro e escuro,
rascunhos não salvos mantidos pelo navegador e formatação para tipos de arquivo compatíveis.
Use Cmd/Ctrl + S para salvar e Shift + Alt + F para formatar.
Use um modelo Ollama instalado e compatível com ferramentas quando quiser manter o tráfego do modelo na infraestrutura do Ollama configurada por você. Um modelo remoto ou em nuvem pode reduzir a pressão da inferência sobre a memória local, mas pode fazer várias chamadas faturáveis e receber resultados solicitados de ferramentas, que podem conter dados do espaço de trabalho.
Interromper uma execução ou visualização mantém o espaço de trabalho. Excluir uma tarefa do Work remove seu espaço de trabalho permanentemente; portanto, copie antes tudo o que você precisar.
Use personas para tarefas repetíveis
Crie personas para fluxos de trabalho recorrentes:
- Um revisor de código conciso com baixa temperatura.
- Um editor de texto com um guia de estilo claro.
- Um assistente de pesquisa com busca em documentos ativada.
- Um assistente de suporte com tom e estrutura de resposta fixos.
As personas armazenam o modelo selecionado, o prompt de sistema, os parâmetros de geração, avatar/plano de fundo e configurações opcionais de memória/mutação. Elas também podem ser exportadas e importadas como JSON.
Mantenha notas duráveis ao lado do seu trabalho
Abra Notas pelo menu de criação quando as informações precisarem permanecer independentes de uma conversa ou tarefa do Work. As notas oferecem visualização de Markdown, edição explícita, busca e salvamento automático. A visualização também renderiza SVG embutido e HTML básico incorporado à nota, com sanitização para que scripts, manipuladores de eventos e URLs inseguras nunca sejam executados. A gaveta de ferramentas da nota adiciona histórico de revisões com restauração, anexos de arquivos, fixação, compartilhamento por usuário (visualização ou edição), exportação em Markdown e uma barra lateral de edição por IA que mostra cada proposta como um diff antes de aplicá-la — e, como a aplicação primeiro cria um snapshot da versão anterior, toda edição por IA pode ser desfeita. As notas pertencem à conta e estão incluídas em um arquivo completo do usuário; o histórico de revisões e os anexos permanecem na instância e não fazem parte do arquivo.
Torne os artifacts mais confiáveis
O Libre WebUI detecta tags explícitas de artifact, blocos de código delimitados, documentos HTML independentes e pacotes HTML comuns com vários arquivos. Para obter o melhor artifact de um modelo, peça:
Create one complete self-contained HTML file.
Inline the CSS and JavaScript.
Do not rely on external files unless they are CDN URLs.
Se quiser blocos separados, dê nomes claros a eles:
```html filename="index.html"
...
```
```css filename="style.css"
...
```
```js filename="app.js"
...
```
O Libre WebUI tentará agrupar os blocos locais de CSS e JavaScript na visualização HTML.
Coloque prompts na fila durante o streaming de uma resposta
Enviar durante a geração coloca o prompt na fila em vez de descartá-lo: os prompts enfileirados aparecem acima do campo de composição, podem ser editados, reordenados e removidos, e são enviados um a um à medida que cada resposta termina. A fila é armazenada com a conversa, portanto sobrevive a um recarregamento ou uma reconexão.
Bifurque uma conversa
O botão de bifurcação de qualquer mensagem copia a conversa até aquele ponto para uma nova conversa, incluindo variantes, e registra sua origem. A original permanece intacta, para que desvios exploratórios nunca poluam a conversa principal.
Compare modelos em uma única interação
O botão de colunas ao lado do seletor de ferramentas distribui seu próximo prompt para até três modelos adicionais. Cada resposta é uma geração independente, com seu próprio rótulo de modelo, estatísticas e controle de cancelamento; assim, modelos lentos ou com falha nunca bloqueiam os demais.
Use o Chat com documentos de forma intencional
O Chat com documentos aceita arquivos PDF, Office (DOCX/PPTX/XLSX), Markdown, HTML, código e CSV de até 10 MB. A busca funciona em dois modos:
- A busca por palavras-chave (BM25) está sempre disponível.
- A busca híbrida combina rankings semânticos e por palavras-chave quando os embeddings estão ativados nas Configurações e há um modelo de embedding disponível.
Instale nomic-embed-text se quiser um modelo local simples para embeddings:
ollama pull nomic-embed-text
Para obter os melhores resultados, envie documentos focados por conversa em vez de um único conjunto enorme de documentos misturados.
Ajuste as configurações de geração
| Configuração | Uso prático |
|---|---|
| Temperatura | Reduza para precisão; aumente para exploração criativa |
| Top P / Top K | Mantenha os padrões, a menos que esteja ajustando a amostragem deliberadamente |
| Janela de contexto | Aumente para conversas longas somente se o modelo e a memória permitirem |
| Máximo de tokens | Limite respostas longas ou aumente para geração de código/artifacts |
| Penalidade de repetição | Aumente um pouco quando um modelo entrar em loop |
Quando um modelo se comportar mal, primeiro reduza a temperatura, depois alivie a pressão do contexto e, por fim, experimente outro modelo.
Decida quanto o modelo deve raciocinar
O controle ao lado do nome do modelo no campo de composição abre os níveis de raciocínio: desativado, ativado, baixo, médio e alto. A escolha pertence à conversa, portanto sobrevive a um recarregamento e é aplicada a uma nova geração; Configurações > Geração contém o padrão para novas respostas, e o painel de controles da conversa mostra o mesmo valor.
Se você não definir nada, nada será enviado, como acontecia em todas as versões anteriores. Ao definir, o servidor converte o valor único para o provedor que responder: o Ollama o recebe no corpo da solicitação, provedores no estilo da OpenAI recebem um nível de esforço de raciocínio, e Anthropic e Gemini recebem um orçamento de tokens com espaço reservado para a resposta.
Vale saber duas coisas. Um modelo que o Ollama informa não ser capaz de raciocinar nunca recebe a configuração, e o controle simplesmente não aparece para ele. Além disso, os níveis nomeados existem somente em modelos que os publicam, como gpt-oss; em um modelo que raciocina sem níveis, um nível nomeado simplesmente se comporta como ativado, para que uma conversa que alterne entre modelos nunca falhe por causa disso. Quando há um padrão global ou fixado, o botão do campo de composição mostra o nível realmente usado pela próxima resposta, e a opção "Padrão" indica em que ele é resolvido no momento.
Observe a janela de contexto
O anel ao lado do nome do modelo é preenchido à medida que a conversa cresce. Passe o cursor para ver quanto da janela está ocupado, os tokens usados e a janela considerada. Ele fica âmbar depois de quatro quintos e vermelho ao atingir a janela; um modelo cuja janela é desconhecida mostra um anel tracejado em vez de um anel vazio.
A contagem abrange o que a próxima solicitação realmente enviará — histórico compactado
e ramificações abandonadas não custam nada. Ela se ancora no valor medido pelo provedor
para a última resposta, quando informado, mais uma estimativa de quatro caracteres
por token para o que foi acrescentado à conversa desde então, marcada com ~ enquanto nenhuma
medição estiver disponível. Uma janela limitada abaixo daquela usada no treinamento do modelo
deixa isso claro: o medidor
mede a janela realmente usada pela solicitação, que é
OLLAMA_MAX_CONTEXT (32.768 por padrão), e não o tamanho total de treinamento do modelo.
Aumente essa variável, e tanto a janela real quanto o medidor acompanharão.
Os modelos de provedores mostram uma janela somente quando a listagem de modelos publica uma. Quando isso não acontece, o medidor continua contando os tokens, mas não tem por qual valor dividi-los.
Deixe as conversas longas se compactarem
Os administradores podem ativar a compactação de contexto em Configurações > Geração. Quando o contexto estimado de uma conversa ultrapassa o limite de tokens, o servidor solicita a um modelo que resuma as mensagens mais antigas e mantém apenas as mais recentes literalmente. O resumo aparece como um cartão de resumo da conversa no ponto em que o histórico foi condensado, e as mensagens resumidas ficam esmaecidas: continuam legíveis, mas deixam de ser enviadas ao modelo. Com a compactação ativada, a quantidade de "mensagens recentes mantidas" também é a janela móvel enviada por uma conversa; portanto, aumentá-la realmente amplia o que o modelo vê.
| Configuração | O que controla |
|---|---|
| Limite de tokens | Tamanho estimado do contexto que aciona uma compactação |
| Mensagens recentes mantidas | Quantas mensagens mais recentes sempre permanecem literais |
| Modelo de compactação | Qual modelo escreve os resumos; por padrão, o modelo da própria conversa |
| Prompt de resumo personalizado | Suas instruções, com {{PREVIOUS_SUMMARY}} e {{MESSAGES}} |
A compactação é desativada por padrão e se aplica a todos os usuários do servidor, mas cada conversa pode decidir: o painel de controles pode desativá-la para uma conversa, e cada cartão de resumo oferece uma opção de desfazer — a restauração reativa exatamente as mensagens substituídas pelo resumo, uma compactação por vez. Ela nunca divide uma interação: as mensagens mantidas literalmente sempre começam em uma mensagem sua. Cada nova compactação incorpora o resumo anterior ao novo, para que a conversa mantenha um único resumo contínuo. Se o modelo de resumo falhar, a geração continua com o histórico não compactado em vez de ser bloqueada.
Mantenha as chaves dos provedores por usuário
Os plugins de provedores podem ler chaves do ambiente, mas credenciais no nível do usuário costumam ser mais organizadas em instalações compartilhadas. Adicione as chaves nas Configurações para que cada usuário controle seu próprio acesso aos provedores.
Use variáveis de ambiente do backend para padrões de toda a implantação ou instalações automatizadas.
Torne o acesso remoto previsível
Para acesso por telefone ou LAN, vincule o servidor de desenvolvimento à interface de rede:
npm run dev:host
Depois, abra o IP da LAN ou do Tailscale da máquina na porta 8080 a partir do outro dispositivo (dev:host disponibiliza o frontend em 8080, e não na porta padrão do Vite). Em produção, defina explicitamente CORS_ORIGIN e a URL da API do frontend para que os navegadores não usem localhost como alternativa.
Verifique sua versão sem sair do aplicativo
Configurações → Sobre compara sua compilação com a versão mais recente do GitHub: ela
informa quando você está atualizado, oferece um link para a página da versão quando está atrasado e
indica quando uma compilação -dev está à frente da versão fixada. A mesma
linha tem um botão Ver registro de alterações que reabre as notas da versão exibidas
após a atualização — e, se o Libre WebUI for útil para você, o link Adicionar estrela no GitHub
é a maneira mais simples de ajudar outras pessoas a encontrá-lo.
Mantenha a documentação e a interface sincronizadas
O produto muda rapidamente. Prefira documentação durável que descreva comportamentos e fluxos de trabalho, e deixe a interface mostrar as listas ativas de modelos dos provedores. Evite copiar catálogos longos de provedores para a documentação, a menos que a lista seja gerada pelo aplicativo.