使用 AI 模型
Libre WebUI 可在同一工作区使用本地 Ollama 模型和由插件支持的云模型。模型管理器 显示已安装和运行中的 Ollama 模型、Ollama Library 实时结果、Hugging Face GGUF 条目,以及可用的 Ollama Cloud 条目。
选择第一个模型
可从以下模型开始,再根据硬件和任务调整:
| 模型 | 适用场景 | 典型配置 |
|---|---|---|
gemma4:12b | 快速通用聊天 | 16 GB RAM 或 8 GB VRAM |
qwen3.8:27b | 通用聊天、编程、多语言 | 32 GB RAM 或 16-24 GB VRAM |
gemma4:26b | 兼具 MoE 效率的强大聊天 | 24 GB RAM 或 16 GB VRAM |
gemma4:31b | 最高质量的稠密本地聊天 | 32 GB RAM 或 24 GB VRAM |
nomic-embed-text | 文档嵌入 | 小型本地嵌入模型 |
30B、70B 和 MoE 等大模型可能表现出色,但需要更多内存。不确定时先从小模型开始, 运行顺畅后再升级。
模型管理器
打开设置 → 模型可以:
- 按名称从 Ollama 拉取模型。
- 实时搜索 Ollama Library,而不是依赖静态列表。
- 查看已安装和运行中的模型。
- 一次操作即可更新所有已安装的 Ollama 模型。
- 停止或卸载运行中的模型。
- 删除不再需要的模型。
- 在兼容时通过 Ollama 拉取 Hugging Face GGUF 模型。
- 从云筛选器拉取 Ollama Cloud 模型。
对于 Ollama Cloud,界面会在拉取前规范模型名称。需要 :cloud 或 -cloud 后缀时,
Libre WebUI 会在云模型流程中自动应用。
模型目录与可见性
设置 → 默认设置中的模型目录列出所有可选聊天模型,包括本地和提供商模型, 并显示提供商徽标和搜索框。在目录上方选择默认模型,即可设置新聊天的起始模型。
管理员可以给模型加星标,将其固定到目录和默认模型菜单的顶部。加星标多个模型时, 最近加星标的排在最前;取消星标后,模型回到原有的手动或提供商排序位置。
管理员还可用眼睛按钮向其他用户隐藏模型。隐藏只是精简列表的策展功能,不是授权 门禁或安全边界。管理员始终看到完整列表及隐藏标记。
本地与云模型
| 模式 | 优点 | 取舍 |
|---|---|---|
| 本地 Ollama | 私有、下载后可离线、成本可预测 | 取决于 CPU、GPU 和 RAM |
| Ollama Cloud | 无本地硬件限制的熟悉 Ollama 流程 | 需要云和网络访问 |
| 提供商插件 | 使用多个提供商管理的模型 | 适用 API 密钥、价格和隐私政策 |
你可以为私密工作保留本地模型,为需要更大托管模型的任务启用提供商插件。
默认视觉模型
你可以与快速文本模型聊天,同时发送图像。在设置 → 默认设置 → 专用模型 → 视觉模型中 选择模型;只要出站聊天上下文包含图像(新附件、会话早期图像或隐身聊天历史),本轮就 路由到视觉模型而非会话模型。纯文本轮次仍使用会话模型。
设置按用户保存,路由自动且静默。保持使用当前聊天模型会禁用它。检查的是图像 是否存在,而非会话模型能力;配置后,所有含图像轮次都使用视觉模型。
选择会同时保存准确提供商身份(Ollama 或特定插件)和模型名称,避免提供商接管同名 模型。如果身份丢失,例如模型或提供商不再可用,含图像轮次会失败。此时请在 设置 → 默认设置 → 专用模型 → 视觉模型中重新选择模型进行修复。明确失败是有意 设计;Libre WebUI 不会静默替换提供商。
Work 模型
Work 需要能调用工具的聊天模型,可使用:
- 宣告
tools能力的已安装 Ollama 模型。 - 通过配置 Ollama 端点提供的 Ollama Cloud 模型。
- 活跃聊天/补全插件列出的模型,且当前管理员已配置凭据。
插件支持的 Work 使用对应适配器:OpenAI 兼容、Anthropic 或 Gemini。Libre WebUI 随任务和每次运行保存准确提供商类型与插件 ID,避免插件接管同名 Ollama 模型。 所选模型或提供商拒绝工具调用时,运行会失败,不会静默切换。
本地 Ollama 让模型请求留在配置的 Ollama 基础设施。远程模型会让提供商收到 Work 系统提示词、对话、工具定义和结果,其中可能包含源文本、命令输出或目录列表。 工作区卷和提供商凭据留在后端主机,但工具结果中的文件内容可能离开主机。
一次自主 Work 运行可多次调用模型。敏感项目应先查看远程提供商的定价、保留和训练 政策。Libre WebUI 会在 Work 中显示按用户可关闭的远程提供商提示。
硬件指南
| 系统 | 实用模型范围 | 说明 |
|---|---|---|
| 仅 CPU,8-16 GB RAM | 1B-4B | 轻量聊天和测试 |
| 8 GB VRAM | 4B-8B 量化 | 舒适起点 |
| 12-16 GB VRAM | 8B-14B 量化 | 日常使用的良好范围 |
| 24 GB VRAM | 14B-32B 量化 | 强大的本地工作站 |
| 48 GB+ VRAM 或大容量统一内存 | 32B-70B 量化 | 大模型实验 |
量化模型使用更少内存。Q4 通常是实用默认值;Q8 使用更多内存换取更好质量。
按任务推荐
| 任务 | 模型方向 |
|---|---|
| 快速聊天 | gemma4:12b 和其他当前小模型 |
| 编程 | Qwen Coder、Codestral、提供商编程模型 |
| 推理 | 更大的 Qwen 和 Gemma 模型、提供商推理模型 |
| 视觉 | LLaVA、Qwen VL 等多模态模型或提供商视觉模型 |
| 文档搜索 | nomic-embed-text 或其他嵌入模型 |
| 文字转语音 | Qwen3-TTS、Kyutai TTS 等 TTS 插件 |
提供商模型名称经常变化。请使用 Libre WebUI 的提供商模型发现功能,或从提供商面板 粘贴准确模型 ID。
提示词与设置
- 温度、令牌限制、上下文长度和惩罚等控制项位于高级生成设置,默认折叠。
- 使用低温度(
0.1-0.3)获得事实性、可重复回答。 - 使用中温度(
0.5-0.7)处理普通助手工作。 - 使用高温度(
0.8+)进行头脑风暴和创意写作。 - 接近内存限制时保持合理上下文长度。
- 需要持久模型参数和可复用系统提示词时使用角色。
故障排除
拉取失败
- 确认 Ollama 正在运行:
ollama list。 - 在终端中尝试同一拉取以查看原始错误。
- 拉取大模型前检查磁盘空间。
- 使用模型管理器云筛选器时,让 Libre WebUI 处理云后缀。
回复缓慢
- 尝试更小模型或更低量化。
- 使用
ollama ps查看已加载内容。 - 关闭其他 GPU 密集型应用。
- 减少上下文长度。
内存不足
- 从 Q8 改为 Q4。
- 使用 8B 而非 14B 模型。
- 只保留需要的模型。
- 在 Docker 中确认容器能访问 GPU 或主机 Ollama。