Dicas avançadas
Esta página reúne fluxos de trabalho práticos que tornam o Libre WebUI mais rápido, organizado e confiável no uso diário.
Mantenha um modelo diário pequeno carregado
Use um modelo local rápido para tarefas rotineiras e mude para modelos maiores somente quando a tarefa exigir.
Bons exemplos para o uso cotidiano:
gemma4:12bpara conversas rápidas do dia a diaqwen3.8:27bpara tarefas gerais mais exigentesgemma4:26bpara eficiência MoE em hardware mais potentegemma4:31bpara obter a melhor qualidade local com modelo densonomic-embed-textpara embeddings de documentos
Abra Modelos para ver quais modelos estão em execução. Descarregue os modelos que não estiver usando quando a VRAM estiver apertada.
Nomeie novas conversas enquanto a resposta é gerada
Ative o Título Automático e escolha um Modelo de Tarefas em Configurações → Padrões. Em uma conversa nova que será salva, a geração do título resume sua primeira mensagem assim que você a envia, junto com a resposta do assistente. A barra lateral é atualizada quando o título fica pronto; uma solicitação de título lenta não bloqueia a resposta.
O modelo de tarefas selecionado e seu provedor cuidam da solicitação do título. Um provedor que serializa solicitações ainda pode colocá-la na fila. Mensagens seguintes, conversas que você já nomeou e conversas anônimas não geram títulos automáticos.
Acompanhe o raciocínio ao vivo
Quando o Título Automático está ativado e um Modelo de Tarefas está selecionado em Configurações → Padrões, o bloco de raciocínio recolhido mostra um resumo curto da atividade enquanto o assistente raciocina. O mesmo modelo de tarefas recebe o trecho mais recente do raciocínio para descrever o assunto atual; escolha um modelo local quando esse texto precisar permanecer na sua máquina.
Os resumos usam no máximo os 4.000 caracteres mais recentes, começam depois que há texto suficiente e são atualizados no máximo uma vez a cada cinco segundos, com apenas uma solicitação em andamento. Um resumo lento ou com falha nunca bloqueia a resposta. O último resumo continua visível naquela mensagem renderizada depois que o raciocínio termina, junto com a duração; expanda o bloco para ler o raciocínio original. Esses resumos são temporários e não são salvos no histórico da conversa.
O texto de atividade é animado conforme muda, com o mesmo indicador de carregamento dos títulos de conversa pendentes. As preferências de movimento reduzido desativam as duas animações. Conversas anônimas e conversas sem um modelo de tarefas ativado mantêm o rótulo comum de raciocínio, sem fazer solicitações de resumo.
Use conversas anônimas para conversas que não devem persistir
Inicie uma conversa anônima pelo menu + da barra de abas, pela paleta de comandos, pela
página inicial ou pelo botão de fantasma na tela de boas-vindas do chat. Ela também tem uma
URL direta: /chat?incognito=1.
Uma conversa anônima nunca persiste: nenhuma sessão é criada no servidor, nenhuma mensagem é salva e ela nunca aparece na barra lateral nem no histórico. A conversa mostra o aviso Modo privado ("Esta conversa não será salva"). Abrir uma conversa salva encerra o modo anônimo; recarregar uma aba anônima inicia uma nova conversa privada vazia, de modo que as interações anteriores desaparecem.
Entenda o limite com clareza: o modo anônimo controla a persistência, e não a exposição ao provedor. O modelo selecionado — local ou remoto — ainda recebe a conversa completa, e o contexto de documentos continua sendo aplicado quando ativado. Para uma conversa que não possa sair da sua infraestrutura, combine o modo anônimo com um modelo Ollama local.
Use a barra lateral compacta
A barra lateral compacta mantém atalhos diretos para Canais, Notas, Calendário, Automações, Personas e Imagine abaixo de Chat e Work, com a Busca por último. O atalho de Agentes aparece quando ele está habilitado para a sua conta. Passe o ponteiro sobre um ícone para ver o rótulo; o destino atual permanece destacado. Em telas baixas, role os atalhos enquanto os controles de configurações e de conta permanecem no rodapé.
Percorra os painéis com rolagem
As listas de Chat e Work esmaecem suavemente nas bordas em que há mais itens disponíveis. O esmaecimento some no início e no fim da lista, e as listas que cabem inteiras continuam totalmente visíveis. O foco do teclado mantém a lista nítida para que os controles sigam legíveis.
A barra de abas superior usa o mesmo esmaecimento nas bordas da rolagem horizontal. Ele some quando todas as abas cabem ou quando você chega a uma das pontas. Selecionar uma aba a traz para a área visível, e o botão de nova aba permanece totalmente visível ao lado da faixa de abas.
O mesmo efeito acompanha a rolagem em Configurações, Chat, Work, páginas de biblioteca, menus e conteúdo de caixas de diálogo, incluindo listas horizontais e tabelas. As Configurações mantêm o título e o campo de busca acima da navegação que rola. Os esmaecimentos se atualizam quando o conteúdo carrega, os filtros mudam ou a janela é redimensionada, e funcionam em todos os temas e em layouts da direita para a esquerda. A navegação por teclado remove o esmaecimento ao redor dos controles em foco; voltar ao mouse ou ao toque o restaura. Os campos de texto e o interior de aplicativos incorporados e de widgets de terminal ou editor mantêm a própria renderização.
Chat e Work usam um esmaecimento mais largo para o conteúdo antigo no topo e abaixo dos botões Novas mensagens e Nova atividade quando você rola para cima. Esses botões continuam nítidos acima do texto esmaecido e levam você de volta ao conteúdo mais recente, onde o esmaecimento inferior desaparece.
Gerencie as abas pelo menu de contexto
Clique com o botão direito em uma aba (ou pressione Shift + F10 com a aba em foco) para:
- Fechar aba
- Fechar outras abas
- Fechar abas à direita
- Fechar todas as abas
Início é sempre a primeira aba e não pode ser fechada. Os administradores podem fixar Sistema, Uso do provedor e Avaliações no rodapé da barra lateral usando o ícone de alfinete no menu do avatar. A administração de contas fica em Configurações → Gerenciamento de Usuários.
Navegue rapidamente com a paleta de comandos
Cmd/Ctrl + K abre a paleta de comandos em qualquer lugar — inclusive quando o
campo de composição está em foco. Ela faz correspondência aproximada entre ações do aplicativo, suas conversas e suas
tarefas do Work; assim, consultas parciais ou com erros ainda funcionam: autmtn encontra
Automações, "pictures" encontra Imagine, "dark" encontra a opção de tema.
A partir de três caracteres, ela também pesquisa no conteúdo de mensagens, notas e documentos
(inclusive notas compartilhadas com você) e mostra um trecho para cada resultado —
isso ocorre na memória sobre seus próprios dados descriptografados; nada é indexado em
texto simples no disco. Os caracteres correspondentes ficam destacados,
os resultados são classificados por relevância e, sem consulta, você vê suas conversas e tarefas
mais recentes. Navegue com ↑/↓, abra com Enter e feche com Esc
(ou Cmd/Ctrl + K novamente).
Tema padrão
Novas instalações usam o tema escuro, aplicado antes da primeira renderização para evitar
um clarão branco. Um administrador pode alterar o padrão de toda a instância em
Configurações > Gerenciamento de Usuários > Configurações padrão > Tema padrão (Claro, Escuro ou Preto Puro). Esse padrão pinta a
página de login, define o valor inicial de cada nova conta e vale em qualquer navegador que
ainda não tenha escolhido um tema; uma preferência pessoal salva sempre é respeitada. O Libre
WebUI não acompanha a configuração de tema do sistema operacional; alterne explicitamente com
Cmd/Ctrl + D, pelo botão de sol/lua ou pelas Configurações. O botão alterna entre Claro,
Escuro, Preto Puro e Celestial.
O tema Celestial acompanha o sol: a paleta e um céu ao vivo (o sol ou a lua em seu arco, nuvens, estrelas depois do anoitecer e uma luz que segue o ponteiro à noite) mudam minuto a minuto, com o nascer e o pôr do sol se deslocando ao longo do ano. Escolha-o em Configurações > Aparência. O relógio celeste no fim da barra de abas abre uma pré-visualização em vidro: arraste ao longo do dia para mover o sol e a lua, ou vá direto para o Nascer do sol ou o Pôr do sol. A mesma pré-visualização está disponível em Aparência. A pré-visualização identifica o horário Ao vivo e a Prévia selecionada manualmente, com rótulos de horário ao longo do controle deslizante. Seguir o relógio, fechar a pré-visualização ou sair de Aparência devolve o horário real. Explorar o dia roda localmente e não salva uma nova configuração de tema. Sem uma localização, ele assume um dia de latitude média; compartilhe sua localização (ou digite as coordenadas) e o nascer e o pôr do sol passam a ser calculados para o seu céu real. A localização é arredondada para cerca de um quilômetro, fica apenas naquele navegador e nunca é enviada ao servidor. As coordenadas digitadas têm rótulos visíveis de Latitude e Longitude. A latitude deve ficar entre -90 e 90; a longitude, entre -180 e 180. Aplicar ou Enter salva coordenadas válidas. Valores inválidos ou incompletos preservam a localização salva; Limpar a remove explicitamente. Com uma localização você também pode ativar Acompanhar o clima: as condições atuais vêm direto do Open-Meteo para o seu navegador, e nuvens, chuva, neve, neblina e vento moldam o céu. Se uma requisição falhar, o Libre mantém o último clima obtido com sucesso nesta sessão e tenta novamente de forma automática enquanto o tema celestial estiver ativo. As novas tentativas começam após 15 segundos e desaceleram para no máximo uma a cada cinco minutos durante uma indisponibilidade. Uma requisição parada por dez segundos é cancelada para não bloquear as atualizações seguintes. Desativar o clima ou mudar a localização cancela as requisições pendentes.
O Celestial usa o mesmo compositor em vidro no Chat e no Work. A posição do sol e da lua se ajusta ao tamanho da tela, e a luz que segue o ponteiro permanece abaixo da superfície de leitura. O movimento decorativo pausa quando a aba fica oculta e responde de imediato à preferência de movimento reduzido do sistema, inclusive durante a varredura de chegada do tema.
Papel de parede da conta
Em Configurações > Aparência > Imagem de Fundo, escolha uma imagem de até 10 MB. A imagem de origem e as configurações ficam salvas na sua conta. O papel de parede aparece na página inicial, no Chat e no Work; ele não pinta a barra lateral, a barra de abas nem as páginas de biblioteca.
Pontilhado cria pixels quadrados bem definidos, com vãos abertos nas sombras, inspirados nas cores da imagem. As áreas claras são suavizadas antes da criação dos pontos, mantendo céus pálidos e fotos claras com textura em vez de uma mancha uniforme. Original usa a imagem lisa e Desfocado acrescenta suavização ajustável. Os três estilos se integram ao tema atual e adaptam os realces para manter a leitura confortável; a imagem enviada nunca é alterada. A Intensidade aparece na hora na pré-visualização e é salva quando você para de ajustá-la. Uma intensidade zero oculta o papel de parede sem removê-lo. Você também pode desativá-lo temporariamente, substituí-lo ou removê-lo.
A pré-visualização funciona nos temas Claro, Escuro (cinza), Preto Puro e Celestial. O papel de parede continua visível quando a navegação é expandida ou recolhida. No celular, a barra lateral cobre parte do conteúdo enquanto o papel de parede descoberto continua visível. Os fundos de personas continuam restritos aos seus próprios chats e não substituem o papel de parede da conta. O processamento da imagem roda no seu navegador. Se uma imagem externa não puder ser processada por causa da política de origem, um substituto visual local é usado.
Receba menções e resultados de automações por e-mail
Depois que um administrador configurar um servidor de e-mail de saída em Configurações → Gerenciamento de Usuários → Acesso e políticas, abra Configurações → Notificações e ative Menções em canais, Resultados de automações, ou ambos. Uma menção chega com a prévia da mensagem e um link para o canal; uma execução de automação chega com a resposta que ela produziu (ou o erro, quando falha) e um link para o chat ou a tarefa do Work resultante. Ambos ficam desativados até você ativá-los, e exigem um endereço de e-mail cadastrado na sua conta.
Mantenha as tarefas do Work focadas
Use uma tarefa do Work separada para cada projeto ou objetivo independente. Cada tarefa tem sua própria conversa, identidade de contêiner gerenciada e arquivos persistentes. O contêiner pode parar ou ser recriado, mas seu volume nomeado sobrevive; portanto, reutilizar a mesma tarefa preserva o contexto útil, enquanto iniciar uma nova tarefa cria uma separação limpa.
Uma boa instrução inicial informa ao modelo:
- O resultado desejado.
- Restrições técnicas ou de design importantes.
- O comando ou comportamento que deve verificar a conclusão.
- Arquivos ou interfaces que devem permanecer inalterados.
Acompanhe o progresso em Atividade e, depois, examine e teste o resultado em Arquivos,
Git, Terminal e Visualização. O editor de arquivos oferece realce de sintaxe nos temas claro e escuro,
rascunhos não salvos mantidos pelo navegador e formatação para tipos de arquivo compatíveis.
Use Cmd/Ctrl + S para salvar e Shift + Alt + F para formatar.
Use um modelo Ollama instalado e compatível com ferramentas quando quiser manter o tráfego do modelo na infraestrutura do Ollama configurada por você. Um modelo remoto ou em nuvem pode reduzir a pressão da inferência sobre a memória local, mas pode fazer várias chamadas faturáveis e receber resultados solicitados de ferramentas, que podem conter dados do espaço de trabalho.
Interromper uma execução ou visualização mantém o espaço de trabalho. Excluir uma tarefa do Work remove seu espaço de trabalho permanentemente; portanto, copie antes tudo o que você precisar.
Use personas para tarefas repetíveis
Crie personas para fluxos de trabalho recorrentes:
- Um revisor de código conciso com baixa temperatura.
- Um editor de texto com um guia de estilo claro.
- Um assistente de pesquisa com busca em documentos ativada.
- Um assistente de suporte com tom e estrutura de resposta fixos.
As personas armazenam o modelo selecionado, o prompt de sistema, os parâmetros de geração, avatar/plano de fundo e configurações opcionais de memória/mutação. Elas também podem ser exportadas e importadas como JSON.
Mantenha notas duráveis ao lado do seu trabalho
Abra Notas pelo menu de criação quando as informações precisarem permanecer independentes de uma conversa ou tarefa do Work. As notas oferecem visualização de Markdown, edição explícita, busca e salvamento automático. A visualização também renderiza SVG embutido e HTML básico incorporado à nota, com sanitização para que scripts, manipuladores de eventos e URLs inseguras nunca sejam executados. A gaveta de ferramentas da nota adiciona histórico de revisões com restauração, anexos de arquivos, fixação, compartilhamento por usuário (visualização ou edição), exportação em Markdown e uma barra lateral de edição por IA que mostra cada proposta como um diff antes de aplicá-la — e, como a aplicação primeiro cria um snapshot da versão anterior, toda edição por IA pode ser desfeita. As notas pertencem à conta e estão incluídas em um arquivo completo do usuário; o histórico de revisões e os anexos permanecem na instância e não fazem parte do arquivo.
Torne os artifacts mais confiáveis
O Libre WebUI detecta tags explícitas de artifact, blocos de código delimitados, documentos HTML independentes e pacotes HTML comuns com vários arquivos. Para obter o melhor artifact de um modelo, peça:
Create one complete self-contained HTML file.
Inline the CSS and JavaScript.
Do not rely on external files unless they are CDN URLs.
Se quiser blocos separados, dê nomes claros a eles:
```html filename="index.html"
...
```
```css filename="style.css"
...
```
```js filename="app.js"
...
```
O Libre WebUI tentará agrupar os blocos locais de CSS e JavaScript na visualização HTML.
Coloque prompts na fila durante o streaming de uma resposta
Enviar durante a geração coloca o prompt na fila em vez de descartá-lo: os prompts enfileirados aparecem acima do campo de composição, podem ser editados, reordenados e removidos, e são enviados um a um à medida que cada resposta termina. A fila é armazenada com a conversa, portanto sobrevive a um recarregamento ou uma reconexão.
Bifurque uma conversa
O botão de bifurcação de qualquer mensagem copia a conversa até aquele ponto para uma nova conversa, incluindo variantes, e registra sua origem. A original permanece intacta, para que desvios exploratórios nunca poluam a conversa principal.
Compare modelos em uma única interação
O botão de colunas ao lado do seletor de ferramentas distribui seu próximo prompt para até três modelos adicionais. Cada resposta é uma geração independente, com seu próprio rótulo de modelo, estatísticas e controle de cancelamento; assim, modelos lentos ou com falha nunca bloqueiam os demais.
Use o Chat com documentos de forma intencional
O Chat com documentos aceita arquivos PDF, Office (DOCX/PPTX/XLSX), Markdown, HTML, código e CSV de até 10 MB. A busca funciona em dois modos:
- A busca por palavras-chave (BM25) está sempre disponível.
- A busca híbrida combina rankings semânticos e por palavras-chave quando os embeddings estão ativados nas Configurações e há um modelo de embedding disponível.
Instale nomic-embed-text se quiser um modelo local simples para embeddings:
ollama pull nomic-embed-text
Para obter os melhores resultados, envie documentos focados por conversa em vez de um único conjunto enorme de documentos misturados.
Ajuste as configurações de geração
| Configuração | Uso prático |
|---|---|
| Temperatura | Reduza para precisão; aumente para exploração criativa |
| Top P / Top K | Mantenha os padrões, a menos que esteja ajustando a amostragem deliberadamente |
| Janela de contexto | Aumente para conversas longas somente se o modelo e a memória permitirem |
| Máximo de tokens | Limite respostas longas ou aumente para geração de código/artifacts |
| Penalidade de repetição | Aumente um pouco quando um modelo entrar em loop |
Quando um modelo se comportar mal, primeiro reduza a temperatura, depois alivie a pressão do contexto e, por fim, experimente outro modelo.
Decida quanto o modelo deve raciocinar
O controle ao lado do nome do modelo no campo de composição abre os níveis de raciocínio: desativado, ativado, baixo, médio e alto. A escolha pertence à conversa, portanto sobrevive a um recarregamento e é aplicada a uma nova geração; Configurações > Geração contém o padrão para novas respostas, e o painel de controles da conversa mostra o mesmo valor.
Se você não definir nada, nada será enviado, como acontecia em todas as versões anteriores.
Ao definir, o servidor converte o valor único para o provedor que responder:
o Ollama o recebe no corpo da solicitação, provedores no estilo da OpenAI recebem um
nível de esforço de raciocínio, e Anthropic e Gemini recebem um orçamento de tokens com espaço
reservado para a resposta. O Claude Sonnet 5.5 e o Opus 5.5 não usam orçamento: eles pensam de forma adaptativa, um nível nomeado vira a configuração de esforço deles, e Desativado no Sonnet 5.5 mantém o raciocínio inicial desligado com o modo between_tools da Anthropic. O Opus 5.5 não tem chave para desligar, então Desativado o deixa no próprio padrão.
Vale saber duas coisas. Um modelo que o Ollama informa não ser capaz de raciocinar nunca recebe a configuração, e o controle simplesmente não aparece para ele. Além disso, os níveis nomeados existem somente em modelos que os publicam, como gpt-oss; em um modelo que raciocina sem níveis, um nível nomeado simplesmente se comporta como ativado, para que uma conversa que alterne entre modelos nunca falhe por causa disso. Quando há um padrão global ou fixado, o botão do campo de composição mostra o nível realmente usado pela próxima resposta, e a opção "Padrão" indica em que ele é resolvido no momento.
Observe a janela de contexto
O anel ao lado do nome do modelo é preenchido à medida que a conversa cresce. Passe o cursor para ver quanto da janela está ocupado, os tokens usados e a janela considerada. Ele fica âmbar depois de quatro quintos e vermelho ao atingir a janela; um modelo cuja janela é desconhecida mostra um anel tracejado em vez de um anel vazio.
A contagem abrange o que a próxima solicitação realmente enviará — histórico compactado
e ramificações abandonadas não custam nada. Ela se ancora no valor medido pelo provedor
para a última resposta, quando informado, mais uma estimativa de quatro caracteres
por token para o que foi acrescentado à conversa desde então, marcada com ~ enquanto nenhuma
medição estiver disponível. Uma janela limitada abaixo daquela usada no treinamento do modelo
deixa isso claro: o medidor
mede a janela realmente usada pela solicitação, que é
OLLAMA_MAX_CONTEXT (32.768 por padrão), e não o tamanho total de treinamento do modelo.
Aumente essa variável, e tanto a janela real quanto o medidor acompanharão.
Os modelos de provedores mostram uma janela somente quando a listagem de modelos publica uma. Quando isso não acontece, o medidor continua contando os tokens, mas não tem por qual valor dividi-los.
Deixe as conversas longas se compactarem
Os administradores podem ativar a compactação de contexto em Configurações > Geração. Quando o contexto estimado de uma conversa ultrapassa o limite de tokens, o servidor solicita a um modelo que resuma as mensagens mais antigas e mantém apenas as mais recentes literalmente. O resumo aparece como um cartão de resumo da conversa no ponto em que o histórico foi condensado, e as mensagens resumidas ficam esmaecidas: continuam legíveis, mas deixam de ser enviadas ao modelo. Com a compactação ativada, a quantidade de "mensagens recentes mantidas" também é a janela móvel enviada por uma conversa; portanto, aumentá-la realmente amplia o que o modelo vê.
| Configuração | O que controla |
|---|---|
| Limite de tokens | Tamanho estimado do contexto que aciona uma compactação |
| Mensagens recentes mantidas | Quantas mensagens mais recentes sempre permanecem literais |
| Modelo de compactação | Qual modelo escreve os resumos; por padrão, o modelo da própria conversa |
| Prompt de resumo personalizado | Suas instruções, com {{PREVIOUS_SUMMARY}} e {{MESSAGES}} |
A compactação é desativada por padrão e se aplica a todos os usuários do servidor, mas cada conversa pode decidir: o painel de controles pode desativá-la para uma conversa, e cada cartão de resumo oferece uma opção de desfazer — a restauração reativa exatamente as mensagens substituídas pelo resumo, uma compactação por vez. Ela nunca divide uma interação: as mensagens mantidas literalmente sempre começam em uma mensagem sua. Cada nova compactação incorpora o resumo anterior ao novo, para que a conversa mantenha um único resumo contínuo. Se o modelo de resumo falhar, a geração continua com o histórico não compactado em vez de ser bloqueada.
Mantenha as chaves dos provedores por usuário
Os plugins de provedores podem ler chaves do ambiente, mas credenciais no nível do usuário costumam ser mais organizadas em instalações compartilhadas. Adicione as chaves nas Configurações para que cada usuário controle seu próprio acesso aos provedores.
Use variáveis de ambiente do backend para padrões de toda a implantação ou instalações automatizadas.
Torne o acesso remoto previsível
Para acesso por telefone ou LAN, vincule o servidor de desenvolvimento à interface de rede:
npm run dev:host
Depois, abra o IP da LAN ou do Tailscale da máquina na porta 8080 a partir do outro dispositivo (dev:host disponibiliza o frontend em 8080, e não na porta padrão do Vite). Em produção, defina explicitamente CORS_ORIGIN e a URL da API do frontend para que os navegadores não usem localhost como alternativa.
Verifique sua versão sem sair do aplicativo
Configurações → Sobre compara sua compilação com a versão mais recente do GitHub: ela
informa quando você está atualizado, oferece um link para a página da versão quando está atrasado e
indica quando uma compilação -dev está à frente da versão fixada. A mesma
linha tem um botão Ver registro de alterações que reabre as notas da versão exibidas
após a atualização — e, se o Libre WebUI for útil para você, o link Adicionar estrela no GitHub
é a maneira mais simples de ajudar outras pessoas a encontrá-lo.
Mantenha a documentação e a interface sincronizadas
O produto muda rapidamente. Prefira documentação durável que descreva comportamentos e fluxos de trabalho, e deixe a interface mostrar as listas ativas de modelos dos provedores. Evite copiar catálogos longos de provedores para a documentação, a menos que a lista seja gerada pelo aplicativo.