跳到主要内容

使用 AI 模型

Libre WebUI 可在同一工作区使用本地 Ollama 模型和由插件支持的云模型。模型管理器 显示已安装和运行中的 Ollama 模型、Ollama Library 实时结果、Hugging Face GGUF 条目,以及可用的 Ollama Cloud 条目。

选择第一个模型

可从以下模型开始,再根据硬件和任务调整:

模型适用场景典型配置
gemma4:12b快速通用聊天16 GB RAM 或 8 GB VRAM
qwen3.8:27b通用聊天、编程、多语言32 GB RAM 或 16-24 GB VRAM
gemma4:26b兼具 MoE 效率的强大聊天24 GB RAM 或 16 GB VRAM
gemma4:31b最高质量的稠密本地聊天32 GB RAM 或 24 GB VRAM
nomic-embed-text文档嵌入小型本地嵌入模型

30B、70B 和 MoE 等大模型可能表现出色,但需要更多内存。不确定时先从小模型开始, 运行顺畅后再升级。

模型管理器

打开设置 → 模型可以:

  • 按名称从 Ollama 拉取模型。
  • 实时搜索 Ollama Library,而不是依赖静态列表。
  • 查看已安装和运行中的模型。
  • 一次操作即可更新所有已安装的 Ollama 模型。
  • 停止或卸载运行中的模型。
  • 删除不再需要的模型。
  • 在兼容时通过 Ollama 拉取 Hugging Face GGUF 模型。
  • 从云筛选器拉取 Ollama Cloud 模型。

对于 Ollama Cloud,界面会在拉取前规范模型名称。需要 :cloud-cloud 后缀时, Libre WebUI 会在云模型流程中自动应用。

模型目录与可见性

设置 → 默认设置中的模型目录列出所有可选聊天模型,包括本地和提供商模型, 并显示提供商徽标和搜索框。在目录上方选择默认模型,即可设置新聊天的起始模型。

管理员可以给模型加星标,将其固定到目录和默认模型菜单的顶部。加星标多个模型时, 最近加星标的排在最前;取消星标后,模型回到原有的手动或提供商排序位置。

管理员还可用眼睛按钮向其他用户隐藏模型。隐藏只是精简列表的策展功能,不是授权 门禁或安全边界。管理员始终看到完整列表及隐藏标记。

本地与云模型

模式优点取舍
本地 Ollama私有、下载后可离线、成本可预测取决于 CPU、GPU 和 RAM
Ollama Cloud无本地硬件限制的熟悉 Ollama 流程需要云和网络访问
提供商插件使用多个提供商管理的模型适用 API 密钥、价格和隐私政策

你可以为私密工作保留本地模型,为需要更大托管模型的任务启用提供商插件。

默认视觉模型

你可以与快速文本模型聊天,同时发送图像。在设置 → 默认设置 → 专用模型 → 视觉模型中 选择模型;只要出站聊天上下文包含图像(新附件、会话早期图像或隐身聊天历史),本轮就 路由到视觉模型而非会话模型。纯文本轮次仍使用会话模型。

设置按用户保存,路由自动且静默。保持使用当前聊天模型会禁用它。检查的是图像 是否存在,而非会话模型能力;配置后,所有含图像轮次都使用视觉模型。

选择会同时保存准确提供商身份(Ollama 或特定插件)和模型名称,避免提供商接管同名 模型。如果身份丢失,例如模型或提供商不再可用,含图像轮次会失败。此时请在 设置 → 默认设置 → 专用模型 → 视觉模型中重新选择模型进行修复。明确失败是有意 设计;Libre WebUI 不会静默替换提供商。

Work 模型

Work 需要能调用工具的聊天模型,可使用:

  • 宣告 tools 能力的已安装 Ollama 模型。
  • 通过配置 Ollama 端点提供的 Ollama Cloud 模型。
  • 活跃聊天/补全插件列出的模型,且当前管理员已配置凭据。

插件支持的 Work 使用对应适配器:OpenAI 兼容、Anthropic 或 Gemini。Libre WebUI 随任务和每次运行保存准确提供商类型与插件 ID,避免插件接管同名 Ollama 模型。 所选模型或提供商拒绝工具调用时,运行会失败,不会静默切换。

本地 Ollama 让模型请求留在配置的 Ollama 基础设施。远程模型会让提供商收到 Work 系统提示词、对话、工具定义和结果,其中可能包含源文本、命令输出或目录列表。 工作区卷和提供商凭据留在后端主机,但工具结果中的文件内容可能离开主机。

一次自主 Work 运行可多次调用模型。敏感项目应先查看远程提供商的定价、保留和训练 政策。Libre WebUI 会在 Work 中显示按用户可关闭的远程提供商提示。

硬件指南

系统实用模型范围说明
仅 CPU,8-16 GB RAM1B-4B轻量聊天和测试
8 GB VRAM4B-8B 量化舒适起点
12-16 GB VRAM8B-14B 量化日常使用的良好范围
24 GB VRAM14B-32B 量化强大的本地工作站
48 GB+ VRAM 或大容量统一内存32B-70B 量化大模型实验

量化模型使用更少内存。Q4 通常是实用默认值;Q8 使用更多内存换取更好质量。

按任务推荐

任务模型方向
快速聊天gemma4:12b 和其他当前小模型
编程Qwen Coder、Codestral、提供商编程模型
推理更大的 Qwen 和 Gemma 模型、提供商推理模型
视觉LLaVA、Qwen VL 等多模态模型或提供商视觉模型
文档搜索nomic-embed-text 或其他嵌入模型
文字转语音Qwen3-TTS、Kyutai TTS 等 TTS 插件

提供商模型名称经常变化。请使用 Libre WebUI 的提供商模型发现功能,或从提供商面板 粘贴准确模型 ID。

提示词与设置

  • 温度、令牌限制、上下文长度和惩罚等控制项位于高级生成设置,默认折叠。
  • 使用低温度(0.1-0.3)获得事实性、可重复回答。
  • 使用中温度(0.5-0.7)处理普通助手工作。
  • 使用高温度(0.8+)进行头脑风暴和创意写作。
  • 接近内存限制时保持合理上下文长度。
  • 需要持久模型参数和可复用系统提示词时使用角色。

故障排除

拉取失败

  • 确认 Ollama 正在运行:ollama list
  • 在终端中尝试同一拉取以查看原始错误。
  • 拉取大模型前检查磁盘空间。
  • 使用模型管理器云筛选器时,让 Libre WebUI 处理云后缀。

回复缓慢

  • 尝试更小模型或更低量化。
  • 使用 ollama ps 查看已加载内容。
  • 关闭其他 GPU 密集型应用。
  • 减少上下文长度。

内存不足

  • 从 Q8 改为 Q4。
  • 使用 8B 而非 14B 模型。
  • 只保留需要的模型。
  • 在 Docker 中确认容器能访问 GPU 或主机 Ollama。

相关文档