Yêu cầu phần cứng
Giao diện Chat nhẹ. Tài nguyên chủ yếu dành cho Ollama; Work thêm CPU, bộ nhớ, tiến trình, image và dung lượng.
Bảng nhanh
| Phần cứng | Mô hình | Ghi chú |
|---|---|---|
| 8 GB RAM, CPU | 1B-4B | Thử nghiệm |
| 16 GB RAM, CPU | 4B-8B | Chậm hơn GPU |
| 8 GB VRAM | 4B-8B | Dùng hàng ngày |
| 12-16 GB VRAM | 8B-14B | Máy trạm mạnh |
| 24 GB VRAM | 14B-32B | Cao cấp |
| 48 GB+ | 32B-70B | Thử mô hình lớn |
Tốc độ phụ thuộc kiến trúc, lượng tử hóa, ngữ cảnh, trình điều khiển và tác vụ khác.
Mô hình khởi đầu
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
nomic-embed-text dành cho embedding.
VRAM và RAM
Mô hình trong VRAM nhanh hơn. RAM cần cho CPU, offload và ngữ cảnh.
Apple Silicon
Dùng bộ nhớ thống nhất, chia sẻ với OS và ứng dụng.
NVIDIA
CUDA thường tương thích tốt nhất. Cập nhật trình điều khiển.
AMD và Intel
Phụ thuộc hỗ trợ Ollama; CPU luôn là phương án dự phòng.
Giảm bộ nhớ
- Mô hình nhỏ
- Q4 thay Q8
- Ngữ cảnh ngắn
- Gỡ mô hình không dùng
Dung lượng Work
Mỗi tác vụ mặc định:
- 2 GB RAM;
- 2 CPU;
- 256 tiến trình.
Giới hạn mặc định hai tác vụ toàn instans và một mỗi admin. Ollama Cloud giảm bộ nhớ mô hình nhưng không bỏ Docker.
Mỗi tác vụ có volume không có hạn ngạch riêng. Theo dõi lưu trữ và sao lưu riêng.
Chỉ chỉnh WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT, WORK_MAX_ACTIVE_RUNTIMES_* sau khi đo host. Xem biến môi trường.