跳到主要内容

进阶技巧

本页汇集了一些实用工作流,让 Libre WebUI 在日常使用中更快速、更整洁、更可靠。

保持加载一个轻量的日常模型​

日常任务使用速度快的本地模型,只在任务确有需要时才切换到更大的模型。

适合作为日常主力的示例:

  • gemma4:12b:快速处理日常对话
  • qwen3.8:27b:胜任要求更高的通用任务
  • gemma4:26b:在更强硬件上发挥 MoE 效率
  • gemma4:31b:获得最佳的本地稠密模型质量
  • nomic-embed-text:生成文档嵌入

打开模型可查看正在运行的模型。显存紧张时,请卸载不用的模型。

在回复生成时为新聊天命名​

在设置 → 默认设置中启用自动标题并选择任务模型。对于新保存的聊天,发送第一条消息后,标题生成会立即与助手回复并行地总结这条消息。标题就绪后侧边栏随之更新;标题请求较慢不会阻塞回复。

标题请求由所选的任务模型及其提供商处理。会串行处理请求的提供商仍可能让它排队等待。后续消息、已经命名的聊天以及无痕聊天不会触发自动标题。

跟随实时思考​

在设置 → 默认设置中启用自动标题并选择任务模型后,折叠的思考块会在助手推理时显示一段简短的活动摘要。同一个任务模型会收到最新的推理片段来描述当前主题,因此当这些文本必须留在本机时,请选择本地模型。

摘要最多使用最新的 4,000 个字符,在积累到足够文本后才开始,并且最多每五秒更新一次,同时只允许一个请求在途。摘要缓慢或失败都不会阻塞回答。思考结束后,最后一条摘要会连同其耗时继续显示在该条已渲染的消息上;展开思考块即可阅读原始推理内容。这些摘要是临时的,不会保存在聊天历史中。

活动文本在变化时会有动画,并使用与待生成聊天标题相同的加载指示。启用减少动态效果偏好会同时关闭这两种动画。无痕聊天以及未启用任务模型的聊天会保留普通的思考标签,不会发出摘要请求。

对不应留存的对话使用无痕聊天​

可以从标签栏的 + 菜单、命令面板、首页或聊天欢迎界面的幽灵按钮启动无痕聊天。也可以直接访问:/chat?incognito=1。

无痕聊天绝不会持久保存:服务器不会创建会话,也不会保存消息,侧边栏和历史记录中都不会出现它。聊天界面会显示私密模式横幅(“此对话不会被保存”)。打开已保存的聊天会退出无痕模式;刷新无痕标签页会开始一个全新的空白私密聊天,因此此前的对话内容会消失。

请明确这一边界:无痕模式控制的是持久化,而不是是否向提供商暴露数据。所选模型——无论本地还是远程——仍会接收完整对话;启用文档上下文后,它也依然会生效。若对话内容绝不能离开你的基础设施,请将无痕模式与本地 Ollama 模型结合使用。

使用紧凑侧边栏​

紧凑侧边栏在 Chat 和 Work 下方保留通往频道、笔记、日历、自动化、角色和想象的直达快捷方式,搜索排在最后。为你的账户启用后,还会出现智能体快捷方式。将指针悬停在图标上可查看其标签;当前所在的目标会保持高亮。屏幕较矮时可以滚动这些快捷方式,而设置和账户控件始终留在底部。

在面板中滚动​

Chat 和 Work 的列表在还有更多内容的边缘会柔和淡出。滚动到列表开头或末尾时淡出消失,能够完整容纳的列表则始终清晰可见。键盘焦点会让列表保持清晰,以便控件依然易读。

顶部标签栏在其水平滚动的边缘使用同样的淡出效果。当所有标签都能放下,或者滚动到任一端时,淡出都会消失。选中某个标签会将其滚动到可见位置,新建标签按钮则始终完整显示在标签条旁边。

设置、Chat、Work、库页面、菜单以及对话框内容中的滚动都有同样的效果,横向列表和表格也不例外。设置页面的标题和搜索框始终位于滚动导航的上方。内容加载、筛选条件变化或窗口尺寸改变时,淡出效果都会随之更新,并且在所有主题以及从右到左的布局中都有效。使用键盘导航时,获得焦点的控件周围的淡出会消失;改用鼠标或触摸后又会恢复。文本输入框,以及内嵌应用和终端/编辑器组件的内部,仍保持各自的渲染方式。

向上滚动时,Chat 和 Work 会在顶部的较早内容处,以及新消息和新活动按钮下方使用更宽的淡出。这两个按钮始终清晰地显示在淡出的文字上方,点击即可回到最新内容,此时底部的淡出会消失。

使用上下文菜单管理标签页​

右键单击标签页(或在标签页获得焦点时按 Shift + F10)可执行:

  • 关闭标签页
  • 关闭其他标签页
  • 关闭右侧标签页
  • 关闭所有标签页

首页始终是第一个标签页,无法关闭。管理员可以通过头像菜单中的固定图标,将系统、提供商使用情况和评测固定到侧边栏底部。用户管理位于设置 → 用户管理中。

用命令面板快速穿梭​

无论身处应用何处,即使输入框正获得焦点,按 Cmd/Ctrl + K 都能打开命令面板。它会在应用操作、你的聊天和 Work 任务之间进行模糊匹配,因此只输入片段或存在拼写错误也能找到结果:autmtn 能找到自动化,“pictures”能找到想象,“dark”能找到主题切换。从输入三个字符开始,它还会搜索消息、笔记和文档内容(包括与你共享的笔记),并为每个结果显示摘要——搜索只会针对内存中你自己的已解密数据执行;磁盘上不会建立明文索引。匹配字符会高亮显示,结果按相关性排序;没有查询内容时则显示最近的聊天和任务。使用 ↑/↓ 导航,按 Enter 打开,按 Esc(或再次按 Cmd/Ctrl + K)关闭。

默认主题​

全新安装默认使用深色主题,并在首次绘制前应用,因此不会闪现浅色界面。管理员可以在设置 > 用户管理 > 默认设置 > 默认主题中修改整个实例的默认值(浅色、深色或纯黑)。该默认值会决定登录页面的外观,作为每个新账户的初始设置,并应用于尚未自行选择主题的浏览器;已保存的个人偏好始终会受到尊重。Libre WebUI 不会跟随操作系统的主题设置;请使用 Cmd/Ctrl + D、太阳/月亮按钮或在设置中明确切换。该切换按钮会在浅色、深色、纯黑和天穹之间循环。

天穹主题跟随太阳:配色与实时天空(沿弧线运行的太阳或月亮、云、黄昏之后的星星,以及夜间跟随指针的灯光)会随分钟推移变化,日出与日落也会随一年中的时节移动。请在设置 > 外观中选择该主题。标签栏末端的天空时钟会打开一个玻璃质感的预览:在一天中横向拖动即可移动太阳和月亮,也可以直接跳到日出或日落。同样的预览也可以在外观中打开。预览会分别标示实时时间和手动选择的预览时间,并沿滑块显示时间标签。点击跟随时钟、关闭预览或离开外观,都会回到实际时间。浏览一天的变化只在本地进行,不会保存新的主题设置。若未提供位置,它会假定一个中纬度的白昼;共享你的位置(或输入坐标)后,日出与日落会按你所在的真实天空计算。位置会被四舍五入到约一公里,仅保存在该浏览器中,绝不会发送到服务器。手动输入坐标时会显示纬度和经度标签。纬度必须介于 -90 与 90 之间,经度必须介于 -180 与 180 之间。选择应用或按 Enter 可保存有效坐标。无效或不完整的输入会保留已保存的位置;清除则会明确将其移除。提供位置后,你还可以开启跟随天气:当前天气状况直接从 Open-Meteo 送到你的浏览器,云、雨、雪、雾和风都会塑造天空的样子。如果请求失败,Libre 会在本次会话中保留最后一次成功获取的天气,并在天穹主题启用期间自动重试。重试从 15 秒后开始,在服务中断期间最慢降至每五分钟一次。停滞十秒的请求会被取消,以免阻塞之后的刷新。关闭天气或更改位置会取消待处理的请求。

天穹主题在聊天和 Work 中使用同一套玻璃质感输入区。太阳和月亮的位置会随屏幕尺寸缩放,指针光晕始终位于阅读区域之下。标签页被隐藏时装饰性动效会暂停,并会立即响应系统的减少动态效果偏好,主题进入时的扫光动画同样如此。

账户壁纸​

在设置 > 外观 > 背景图片中,可选择不超过 10 MB 的图片。源图片及其设置会保存到你的账户。壁纸会出现在首页以及聊天和 Work 中,不会绘制侧边栏、标签栏或库页面。

抖色会依据图片的配色生成清晰的方形像素,并在暗部留出空隙。明亮区域会先经过柔化再生成点阵,让浅色天空和明亮照片保持质感,而不是变成一片纯色。原图使用平滑的图像,模糊则提供可调节的柔化程度。三种样式都会融入当前主题,并调整高光以保证可读性;上传的源文件不会被改动。强度会立即预览,并在你停止调整后保存。强度为零会隐藏壁纸,但不会将其移除。你也可以临时停用、替换或移除壁纸。

预览在浅色、深色(灰色)、纯黑和天穹主题下均可使用。展开或收起导航时壁纸始终保持可见。在手机上,侧边栏会覆盖部分内容,未被遮挡的壁纸仍然可见。角色背景仍只作用于其所属的聊天,不会替换账户壁纸。图片处理在你的浏览器中完成。如果外部图片因其来源策略而无法处理,则会使用本地的视觉回退方案。

通过邮件接收提及和自动化结果​

管理员在设置 → 用户管理 → 访问与策略中配置好发件邮件服务器后,打开设置 → 通知,开启频道提及、自动化结果,或两者都开启。提及会连同消息预览和指向该频道的链接一起送达;自动化运行会连同它产出的回复(失败时则是错误信息)和指向对应聊天或 Work 任务的链接一起送达。两者默认都是关闭的,需要你手动开启,并且都要求你的账户已设置邮箱地址。

让 Work 任务保持专注​

每个项目或彼此独立的目标都应使用单独的 Work 任务。每项任务都有自己的对话、受管容器身份和持久文件。容器本身可以停止或重新创建,但其命名卷仍会保留,因此复用同一任务可延续有用的上下文,新建任务则会形成清晰的边界。

一条好的初始指令会向模型说明:

  • 你想得到的结果。
  • 重要的技术或设计约束。
  • 用于验证完成情况的命令或行为。
  • 任何必须保持不变的文件或界面。

在活动中跟踪进度,然后在文件、Git、终端和预览中检查并测试结果。文件编辑器支持浅色和深色主题的语法高亮、由浏览器保存的未保存草稿,以及对受支持文件类型的格式化。使用 Cmd/Ctrl + S 保存,使用 Shift + Alt + F 格式化。

若希望模型流量留在已配置的 Ollama 基础设施中,请使用已安装且支持工具调用的 Ollama 模型。远程或云模型可以减轻本地推理内存压力,但可能会产生多次计费调用,并会收到所请求的工具结果,其中可能包含工作区数据。

停止运行或预览不会删除工作区。删除 Work 任务会永久移除其工作区,因此请先复制出需要保留的内容。

使用角色实现可复用的工作流​

为经常重复的工作流创建角色:

  • 使用低温度的简洁代码审查员。
  • 遵循明确风格指南的写作编辑。
  • 启用文档搜索的研究助理。
  • 采用固定语气和回复结构的支持助理。

角色会保存所选模型、系统提示词、生成参数、头像/背景,以及可选的记忆/变更设置。也可以将角色导出和导入为 JSON。

在工作旁保存持久笔记​

若信息需要独立于某次聊天或 Work 任务长期保存,请从创建菜单打开笔记。笔记支持 Markdown 预览、显式编辑、搜索和自动保存。预览也能渲染笔记中嵌入的内联 SVG 和基础 HTML,并会进行清理,确保脚本、事件处理程序和不安全 URL 永远不会执行。笔记工具抽屉还提供修订历史及恢复、文件附件、固定、按用户共享(查看或编辑)、Markdown 导出,以及 AI 编辑侧边栏。每项 AI 修改在应用前都会以差异形式预览;由于应用修改前会先保存上一版本的快照,任何 AI 编辑都可撤销。笔记属于账户范围,并包含在完整用户归档中;修订历史和附件保留在实例上,不会纳入归档。

提高产物的可靠性​

Libre WebUI 能识别显式产物标签、围栏代码块、独立 HTML 文档,以及常见的多文件 HTML 包。为了让模型输出最佳产物,请这样要求:

Create one complete self-contained HTML file.
Inline the CSS and JavaScript.
Do not rely on external files unless they are CDN URLs.

如果需要分开的代码块,请清楚标注名称:

```html filename="index.html"
...
```

```css filename="style.css"
...
```

```js filename="app.js"
...
```

Libre WebUI 会尝试把本地 CSS 和 JavaScript 代码块打包到 HTML 预览中。

在回复流式生成时将提示词加入队列​

在生成期间发送提示词会将其加入队列,而不会丢弃:队列中的提示词显示在输入框上方,可编辑、重新排序和移除,并在每条回复完成后依次发送。队列随聊天一起保存,因此刷新或重新连接后仍会保留。

分叉对话​

任意消息上的分叉按钮会把截至该处的对话(包括变体)复制到新聊天中,并记录其来源。原对话保持不变,因此探索性的旁支不会干扰主线。

在一轮对话中比较模型​

工具选择器旁边的分栏按钮可将下一条提示词同时发送给最多三个额外模型。每条回复都是独立生成,拥有自己的模型标签、统计信息和取消控件,因此缓慢或失败的模型不会阻塞其他模型。

有意识地使用文档聊天​

文档聊天支持最大 10 MB 的 PDF、Office(DOCX/PPTX/XLSX)、Markdown、HTML、代码和 CSV 文件。搜索有两种模式:

  • 关键词搜索(BM25)始终可用。
  • 在设置中启用嵌入且嵌入模型可用时,混合搜索会融合语义排名与关键词排名。

若需要易用的本地嵌入模型,请安装 nomic-embed-text:

ollama pull nomic-embed-text

为获得最佳结果,请按聊天上传主题集中的文档,而不要使用一套庞大且混杂的文档集。

调整生成设置​

设置实际用途
温度要求准确时调低,进行创意探索时调高
Top P / Top K除非有意调优采样,否则保留默认值
上下文窗口仅在模型和内存能够承受时,才为长对话增大
最大令牌数限制长回复,或为代码/产物生成提高上限
重复惩罚模型出现循环时略微提高

模型表现不佳时,先降低温度,再减轻上下文压力,最后尝试其他模型。

决定模型思考的深度​

输入框中模型名称旁的控件可打开推理级别:关闭、开启、低、中和高。此选择属于对话,因此刷新后仍会保留,并应用于重新生成;设置 > 生成保存新回复的默认值,聊天控件面板则显示同一数值。

若不设置,便不会发送任何值,这与此前所有版本的行为一致。设置后,无论由哪个提供商作答,服务器都会转换这个统一值:Ollama 会在请求正文中接收它;OpenAI 风格的提供商会接收推理强度;Anthropic 和 Gemini 则会接收令牌预算,并为答案预留空间。Claude Sonnet 5.5 和 Opus 5.5 不接收预算:它们会自适应地思考,具名级别会成为其推理强度设置,而在 Sonnet 5.5 上选择关闭时,会通过 Anthropic 的 between_tools 模式保持不在开头进行思考。Opus 5.5 没有关闭开关,因此关闭会让它保持自身的默认行为。

有两点值得注意。若 Ollama 报告某模型无法推理,该模型完全不会收到此设置,界面也不会显示控件。其次,具名级别只存在于发布这些级别的模型上,例如 gpt-oss;对支持推理但不提供级别的模型,具名级别只会等同于开启,因此聊天在不同模型间切换时不会因此报错。设置全局或固定默认值后,输入框按钮会显示下一条回复实际采用的级别,“默认”条目也会说明它当前解析成什么值。

留意上下文窗口​

对话变长时,模型名称旁的圆环会逐渐填满。悬停可查看窗口使用比例、已用令牌数和对应窗口大小。超过五分之四时变为琥珀色,达到窗口上限时变为红色;窗口大小未知的模型会显示虚线圆环,而不是空圆环。

计数反映下一次请求实际发送的内容——已压缩的历史和已放弃的分支不占用空间。若提供商报告了上次回复的测量值,计数会以该值为基准,再按每个令牌四个字符估算此后对话新增的内容;尚无测量值时会标注 ~。若实际窗口被限制得小于模型训练窗口,界面会明确说明:仪表衡量的是请求实际使用的窗口,即 OLLAMA_MAX_CONTEXT(默认 32,768),而不是模型完整的训练长度。提高该变量后,实际窗口和仪表都会同步变化。

只有在提供商的模型列表公布窗口大小时,提供商模型才会显示窗口。未公布时,仪表仍会统计令牌,只是没有窗口大小可用于计算比例。

让长对话自动压缩​

管理员可以在设置 > 生成中开启上下文压缩。当对话的估算上下文超过令牌阈值后,服务器会要求模型总结较早的消息,并只逐字保留最近的消息。摘要会以对话摘要卡片的形式出现在历史折叠处,而被摘要的消息会以淡化样式显示:仍可阅读,但不再发送给模型。启用压缩后,“保留的最近消息数”也是对话实际发送的滚动窗口,因此提高它确实会扩大模型所见内容。

设置控制内容
令牌阈值触发压缩的估算上下文大小
保留的最近消息数始终逐字保留的最新消息数量
压缩模型撰写摘要的模型;默认使用对话本身的模型
自定义摘要提示词你的自定义指令,包含 {{PREVIOUS_SUMMARY}} 和 {{MESSAGES}}

压缩默认关闭,并适用于服务器上的所有用户,但每个聊天仍可自行决定:聊天控件面板可以针对单个对话关闭压缩,每张摘要卡片也都提供撤销操作——恢复时会逐次压缩地精确重新激活被该摘要替代的消息。它绝不会拆分一轮对话:逐字保留的消息总是从你自己的一条消息开始。每次新压缩都会把上一份摘要折叠进新摘要,因此一段对话只携带一份持续更新的摘要。如果摘要模型失败,生成会继续使用未压缩的历史,而不会被它阻塞。

为每位用户单独保存提供商密钥​

提供商插件可以读取环境密钥,但对共享安装而言,用户级凭据通常更清晰。请在设置中添加密钥,让每位用户自行控制提供商访问权限。

后端环境变量适合用作整个部署范围的默认值或自动化安装。

让远程访问可预测​

要从手机或局域网访问,请将开发服务器绑定到网络接口:

npm run dev:host

然后在另一台设备上打开该机器的局域网或 Tailscale IP,使用端口 8080(dev:host 的前端运行在 8080,而不是 Vite 的默认端口)。生产环境中,请明确设置 CORS_ORIGIN 和前端 API URL,避免浏览器回退到 localhost。

无需离开应用即可检查版本​

设置 → 关于会将当前构建与最新 GitHub 发行版进行比较:版本最新时会提示你;版本落后时会链接到发行页面;运行领先于固定发行版的 -dev 构建时也会明确说明。同一行的查看变更日志按钮可重新打开升级后看过的发行说明——如果 Libre WebUI 对你有用,旁边的在 GitHub 上加星链接是帮助其他人发现它最简单的方式。

让文档与界面保持同步​

产品变化很快。优先编写描述行为和工作流、经得起时间考验的文档,并由界面显示来自提供商的实时模型列表。除非列表由应用生成,否则不要把冗长的提供商目录复制进文档。

相关文档​