硬件要求
Libre WebUI 的普通聊天界面很轻量,主要资源由本地 Ollama 模型消耗;Work 容器另需 CPU、内存、进程、镜像和项目存储。
快速参考
| 硬件 | 实用本地模型 | 说明 |
|---|---|---|
| 8 GB RAM,仅 CPU | 1B-4B 量化 | 测试和轻量聊天 |
| 16 GB RAM,仅 CPU | 4B-8B 量化 | 可用,但慢于 GPU |
| 8 GB VRAM | 4B-8B 量化 | 良好的日常配置 |
| 12-16 GB VRAM | 8B-14B 量化 | 强力工作站范围 |
| 24 GB VRAM | 14B-32B 量化 | 高端本地使用 |
| 48 GB+ VRAM 或大量统一内存 | 32B-70B 量化 | 大模型实验 |
实际速度取决于架构、量化、上下文、驱动和其他进程。
推荐入门模型
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
nomic-embed-text 用于文档 Embedding,不是聊天模型。
VRAM 与 RAM
模型装入 VRAM 时响应快得多;溢出到系统 RAM 后仍可能工作,但会变慢。RAM 也影响 CPU 推理、GPU Offload、长上下文和应用本身。
Apple Silicon
统一内存由模型、系统和应用共享。更大统一内存可运行比同等离散 VRAM 所暗示更大的量化模型。应为浏览器、后端和系统保留足够内存。
NVIDIA
NVIDIA 通常通过 CUDA 提供最佳兼容性。使用最新驱动,并在容器中运行 Ollama 时检查 Docker GPU 访问。
AMD 与 Intel
支持取决于 Ollama 和平台驱动;没有 GPU 加速时仍可使用 CPU 推理。
减少内存使用
- 使用更小模型和 Q4 而非 Q8。
- 缩短上下文。
- 卸载未使用模型。
- 分开选择文档 Embedding 与聊天模型。
Work 运行时容量
每个活动任务容器默认限制为:
- 2 GB 内存;
- 2 个 CPU;以及
- 256 个进程。
后端默认允许整个实例两个活动容器任务、每位管理员一个。这些是上限而非预留;应同时预算 WebUI、浏览器、Docker、Ollama 和任务容器。Apple Silicon 上它们共享统一内存。
远程模型可减少本地模型 RAM/VRAM,但不能消除 Docker 和容器资源要求。每个任务都有无单独磁盘配额的 Docker Volume,安装依赖可能耗尽存储。请监控并单独备份任务卷。
仅在测量主机后调整 WORK_MEMORY_LIMIT、WORK_CPU_LIMIT、WORK_PIDS_LIMIT 和 WORK_MAX_ACTIVE_RUNTIMES_*。参阅环境变量。