进阶技巧
本页汇集了一些实用工作流,让 Libre WebUI 在日常使用中更快速、更整洁、更可靠。
保持加载一个轻量的日常模型
日常任务使用速度快的本地模型,只在任务确有需要时才切换到更大的模型。
适合作为日常主力的示例:
gemma4:12b:快速处理日常对话qwen3.8:27b:胜任要求更高的通用任务gemma4:26b:在更强硬件上发挥 MoE 效率gemma4:31b:获得最佳的本地稠密模型质量nomic-embed-text:生成文档嵌入
打开模型可查看正在运行的模型。显存紧张时,请卸载不用的模型。
对不应留存的对话使用无痕聊天
可以从标签栏的 + 菜单、命令面板、首页或聊天欢迎界面的幽灵按钮启动无痕聊天。也可以直接访问:/chat?incognito=1。
无痕聊天绝不会持久保存:服务器不会创建会话,也不会保存消息,侧边栏和历史记录中都不会出现它。聊天界面会显示私密模式横幅(“此对话不会被保存”)。打开已保存的聊天会退出无痕模式;刷新无痕标签页会开始一个全新的空白私密聊天,因此此前的对话内容会消失。
请明确这一边界:无痕模式控制的是持久化,而不是是否向提供商暴露数据。所选模型——无论本地还是远程——仍会接收完整对话;启用文档上下文后,它也依然会生效。若对话内容绝不能离开你的基础设施,请将无痕模式与本地 Ollama 模型结合使用。
使用上下文菜单管理标签页
右键单击标签页(或在标签页获得焦点时按 Shift + F10)可执行:
- 关闭标签页
- 关闭其他标签页
- 关闭右侧标签页
- 关闭所有标签页
首页始终是第一个标签页,无法关闭。管理员还能在 + 菜单中直接看到用户管理、系统和提供商用量入口;也可通过头像菜单中的固定图标,将三者中的任意一项固定到侧边栏底部(设置旁边),以后无需再打开菜单。
用命令面板快速穿梭
无论身处应用何处,即使输入框正获得焦点,按 Cmd/Ctrl + K 都能打开命令面板。它会在应用操作、你的聊天和 Work 任务之间进行模糊匹配,因此只输入片段或存在拼写错误也能找到结果:autmtn 能找到自动化,“pictures”能找到想象,“dark”能找到主题切换。从输入三个字符开始,它还会搜索消息、笔记和文档内容(包括与你共享的笔记),并为每个结果显示摘要——搜索只会针对内存中你自己的已解密数据执行;磁盘上不会建立明文索引。匹配字符会高亮显示,结果按相关性排序;没有查询内容时则显示最近的聊天和任务。使用 ↑/↓ 导航,按 Enter 打开,按 Esc(或再次按 Cmd/Ctrl + K)关闭。
默认主题
全新安装默认使用深色主题,并在首次绘制前应用,因此不会闪现浅色界面。管理员可以在设置 > 用户管理 > 默认主题中修改整个实例的默认值(浅色、深色或纯黑)。该默认值会决定登录页面的外观,作为每个新账户的初始设置,并应用于尚未自行选择主题的浏览器;已保存的个人偏好始终会受到尊重。Libre WebUI 不会跟随操作系统的主题设置;请使用 Cmd/Ctrl + D、太阳/月亮按钮或在设置中明确切换。该切换按钮会在浅色、深色、纯黑和天穹之间循环。
天穹主题跟随太阳:配色与实时天空(沿弧线运行的太阳或月亮、云、黄昏之后的星星,以及夜间跟随指针的灯光)会随分钟推移变化,日出与日落也会随一年中的时节移动。请在设置 > 外观中选择该主题;那里的一天中的时间滑块可以预览一天中的任意时刻,跟随时钟则会回到实际时间。若未提供位置,它会假定一个中纬度的白昼;共享你的位置(或输入坐标)后,日出与日落会按你所在的真实天空计算。位置会被四舍五入到约一公里,仅保存在该浏览器中,绝不会发送到服务器。提供位置后,你还可以开启跟随天气:当前天气状况直接从 Open-Meteo 送到你的浏览器,云、雨、雪、雾和风都会塑造天空的样子。
让 Work 任务保持专注
每个项目或彼此独立的目标都应使用单独的 Work 任务。每项任务都有自己的对话、受管容器身份和持久文件。容器本身可以停止或重新创建,但其命名卷仍会保留,因此复用同一任务可延续有用的上下文,新建任务则会形成清晰的边界。
一条好的初始指令会向模型说明:
- 你想得到的结果。
- 重要的技术或设计约束。
- 用于验证完成情况的命令或行为。
- 任何必须保持不变的文件或界面。
在活动中跟踪进度,然后在文件、Git、终端和预览中检查并测试结果。文件编辑器支持浅色和深色主题的语法高亮、由浏览器保存的未保存草稿,以及对受支持文件类型的格式化。使用 Cmd/Ctrl + S 保存,使用 Shift + Alt + F 格式化。
若希望模型流量留在已配置的 Ollama 基础设施中,请使用已安装且支持工具调用的 Ollama 模型。远程或云模型可以减轻本地推理内存压力,但可能会产生多次计费调用,并会收到所请求的工具结果,其中可能包含工作区数据。
停止运行或预览不会删除工作区。删除 Work 任务会永久移除其工作区,因此请先复制出需要保留的内容。
使用角色实现可复用的工作流
为经常重复的工作流创建角色:
- 使用低温度的简洁代码审查员。
- 遵循明确风格指南的写作编辑。
- 启用文档搜索的研究助理。
- 采用固定语气和回复结构的支持助理。
角色会保存所选模型、系统提示词、生成参数、头像/背景,以及可选的记忆/变更设置。也可以将角色导出和导入为 JSON。
在工作旁保存持久笔记
若信息需要独立于某次聊天或 Work 任务长期保存,请从创建菜单打开笔记。笔记支持 Markdown 预览、显式编辑、搜索和自动保存。预览也能渲染笔记中嵌入的内联 SVG 和基础 HTML,并会进行清理,确保脚本、事件处理程序和不安全 URL 永远不会执行。笔记工具抽屉还提供修订历史及恢复、文件附件、固定、按用户共享(查看或编辑)、Markdown 导出,以及 AI 编辑侧边栏。每项 AI 修改在应用前都会以差异形式预览;由于应用修改前会先保存上一版本的快照,任何 AI 编辑都可撤销。笔记属于账户范围,并包含在完整用户归档中;修订历史和附件保留在实例上,不会纳入归档。
提高产物的可靠性
Libre WebUI 能识别显式产物标签、围栏代码块、独立 HTML 文档,以及常见的多文件 HTML 包。为了让模型输出最佳产物,请这样要求:
Create one complete self-contained HTML file.
Inline the CSS and JavaScript.
Do not rely on external files unless they are CDN URLs.
如果需要分开的代码块,请清楚标注名称:
```html filename="index.html"
...
```
```css filename="style.css"
...
```
```js filename="app.js"
...
```
Libre WebUI 会尝试把本地 CSS 和 JavaScript 代码块打包到 HTML 预览中。
在回复流式生成时将提示词加入队列
在生成期间发送提示词会将其加入队列,而不会丢弃:队列中的提示词显示在输入框上方,可编辑、重新排序和移除,并在每条回复完成后依次发送。队列随聊天一起保存,因此刷新或重新连接后仍会保留。
分叉对话
任意消息上的分叉按钮会把截至该处的对话(包括变体)复制到新聊天中,并记录其来源。原对话保持不变,因此探索性的旁支不会干扰主线。
在一轮对话中比较模型
工具选择器旁边的分栏按钮可将下一条提示词同时发送给最多三个额外模型。每条回复都是独立生成,拥有自己的模型标签、统计信息和取消控件,因此缓慢或失败的模型不会阻塞其他模型。
有意识地使用文档聊天
文档聊天支持最大 10 MB 的 PDF、Office(DOCX/PPTX/XLSX)、Markdown、HTML、代码和 CSV 文件。搜索有两种模式:
- 关键词搜索(BM25)始终可用。
- 在设置中启用嵌入且嵌入模型可用时,混合搜索会融合语义排名与关键词排名。
若需要易用的本地嵌入模型,请安装 nomic-embed-text:
ollama pull nomic-embed-text
为获得最佳结果,请按聊天上传主题集中的文档,而不要使用一套庞大且混杂的文档集。
调整生成设置
| 设置 | 实际用途 |
|---|---|
| 温度 | 要求准确时调低,进行创意探索时调高 |
| Top P / Top K | 除非有意调优采样,否则保留默认值 |
| 上下文窗口 | 仅在模型和内存能够承受时,才为长对话增大 |
| 最大令牌数 | 限制长回复,或为代码/产物生成提高上限 |
| 重复惩罚 | 模型出现循环时略微提高 |
模型表现不佳时,先降低温度,再减轻上下文压力,最后尝试其他模型。
决定模型思考的深度
输入框中模型名称旁的控件可打开推理级别:关闭、开启、低、中和高。此选择属于对话,因此刷新后仍会保留,并应用于重新生成;设置 > 生成保存新回复的默认值,聊天控件面板则显示同一数值。
若不设置,便不会发送任何值,这与此前所有版本的行为一致。设置后,无论由哪个提供商作答,服务器都会转换这个统一值:Ollama 会在请求正文中接收它;OpenAI 风格的提供商会接收推理强度;Anthropic 和 Gemini 则会接收令牌预算,并为答案预留空间。
有两点值得注意。若 Ollama 报告某模型无法推理,该模型完全不会收到此设置,界面也不会显示控件。其次,具名级别只存在于发布这些级别的模型上,例如 gpt-oss;对支持推理但不提供级别的模型,具名级别只会等同于开启,因此聊天在不同模型间切换时不会因此报错。设置全局或固定默认值后,输入框按钮会显示下一条回复实际采用的级别,“默认”条目也会说明它当前解析成什么值。
留意上下文窗口
对话变长时,模型名称旁的圆环会逐渐填满。悬停可查看窗口使用比例、已用令牌数和对应窗口大小。超过五分之四时变为琥珀色,达到窗口上限时变为红色;窗口大小未知的模型会显示虚线圆环,而不是空圆环。
计数反映下一次请求实际发送的内容——已压缩的历史和已放弃的分支不占用空间。若提供商报告了上次回复的测量值,计数会以该值为基准,再按每个令牌四个字符估算此后对话新增的内容;尚无测量值时会标注 ~。若实际窗口被限制得小于模型训练窗口,界面会明确说明:仪表衡量的是请求实际使用的窗口,即 OLLAMA_MAX_CONTEXT(默认 32,768),而不是模型完整的训练长度。提高该变量后,实际窗口和仪表都会同步变化。
只有在提供商的模型列表公布窗口大小时,提供商模型才会显示窗口。未公布时,仪表仍会统计令牌,只是没有窗口大小可用于计算比例。
让长对话自动压缩
管理员可以在设置 > 生成中开启上下文压缩。当对话的估算上下文超过令牌阈值后,服务器会要求模型总结较早的消息,并只逐字保留最近的消息。摘要会以对话摘要卡片的形式出现在历史折叠处,而被摘要的消息会以淡化样式显示:仍可阅读,但不再发送给模型。启用压缩后,“保留的最近消息数”也是对话实际发送的滚动窗口,因此提高它确实会扩大模型所见内容。
| 设置 | 控制内容 |
|---|---|
| 令牌阈值 | 触发压缩的估算上下文大小 |
| 保留的最近消息数 | 始终逐字保留的最新消息数量 |
| 压缩模型 | 撰写摘要的模型;默认使用对话本身的模型 |
| 自定义摘要提示词 | 你的自定义指令,包含 {{PREVIOUS_SUMMARY}} 和 {{MESSAGES}} |
压缩默认关闭,并适用于服务器上的所有用户,但每个聊天仍可自行决定:聊天控件面板可以针对单个对话关闭压缩,每张摘要卡片也都提供撤销操作——恢复时会逐次压缩地精确重新激活被该摘要替代的消息。它绝不会拆分一轮对话:逐字保留的消息总是从你自己的一条消息开始。每次新压缩都会把上一份摘要折叠进新摘要,因此一段对话只携带一份持续更新的摘要。如果摘要模型失败,生成会继续使用未压缩的历史,而不会被它阻塞。
为每位用户单独保存提供商密钥
提供商插件可以读取环境密钥,但对共享安装而言,用户级凭据通常更清晰。请在设置中添加密钥,让每位用户自行控制提供商访问权限。
后端环境变量适合用作整个部署范围的默认值或自动化安装。
让远程访问可预测
要从手机或局域网访问,请将开发服务器绑定到网络接口:
npm run dev:host
然后在另一台设备上打开该机器的局域网或 Tailscale IP,使用端口 8080(dev:host 的前端运行在 8080,而不是 Vite 的默认端口)。生产环境中,请明确设置 CORS_ORIGIN 和前端 API URL,避免浏览器回退到 localhost。
无需离开应用即可检查版本
设置 → 关于会将当前构建与最新 GitHub 发行版进行比较:版本最新时会提示你;版本落后时会链接到发行页面;运行领先于固定发行版的 -dev 构建时也会明确说明。同一行的查看变更日志按钮可重新打开升级后看过的发行说明——如果 Libre WebUI 对你有用,旁边的在 GitHub 上加星链接是帮助其他人发现它最简单的方式。
让文档与界面保持同步
产品变化很快。优先编写描述行为和工作流、经得起时间考验的文档,并由界面显示来自提供商的实时模型列表。除非列表由应用生成,否则不要把冗长的提供商目录复制进文档。