跳到主要内容

硬件要求

Libre WebUI 的普通聊天界面很轻量,主要资源由本地 Ollama 模型消耗;Work 容器另需 CPU、内存、进程、镜像和项目存储。

快速参考

硬件实用本地模型说明
8 GB RAM,仅 CPU1B-4B 量化测试和轻量聊天
16 GB RAM,仅 CPU4B-8B 量化可用,但慢于 GPU
8 GB VRAM4B-8B 量化良好的日常配置
12-16 GB VRAM8B-14B 量化强力工作站范围
24 GB VRAM14B-32B 量化高端本地使用
48 GB+ VRAM 或大量统一内存32B-70B 量化大模型实验

实际速度取决于架构、量化、上下文、驱动和其他进程。

推荐入门模型

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

nomic-embed-text 用于文档 Embedding,不是聊天模型。

VRAM 与 RAM

模型装入 VRAM 时响应快得多;溢出到系统 RAM 后仍可能工作,但会变慢。RAM 也影响 CPU 推理、GPU Offload、长上下文和应用本身。

Apple Silicon

统一内存由模型、系统和应用共享。更大统一内存可运行比同等离散 VRAM 所暗示更大的量化模型。应为浏览器、后端和系统保留足够内存。

NVIDIA

NVIDIA 通常通过 CUDA 提供最佳兼容性。使用最新驱动,并在容器中运行 Ollama 时检查 Docker GPU 访问。

AMD 与 Intel

支持取决于 Ollama 和平台驱动;没有 GPU 加速时仍可使用 CPU 推理。

减少内存使用

  • 使用更小模型和 Q4 而非 Q8。
  • 缩短上下文。
  • 卸载未使用模型。
  • 分开选择文档 Embedding 与聊天模型。

Work 运行时容量

每个活动任务容器默认限制为:

  • 2 GB 内存;
  • 2 个 CPU;以及
  • 256 个进程。

后端默认允许整个实例两个活动容器任务、每位管理员一个。这些是上限而非预留;应同时预算 WebUI、浏览器、Docker、Ollama 和任务容器。Apple Silicon 上它们共享统一内存。

远程模型可减少本地模型 RAM/VRAM,但不能消除 Docker 和容器资源要求。每个任务都有无单独磁盘配额的 Docker Volume,安装依赖可能耗尽存储。请监控并单独备份任务卷。

仅在测量主机后调整 WORK_MEMORY_LIMITWORK_CPU_LIMITWORK_PIDS_LIMITWORK_MAX_ACTIVE_RUNTIMES_*。参阅环境变量

相关文档