Chuyển tới nội dung chính

Yêu cầu phần cứng

Giao diện Chat nhẹ. Tài nguyên chủ yếu dành cho Ollama; Work thêm CPU, bộ nhớ, tiến trình, image và dung lượng.

Bảng nhanh

Phần cứngMô hìnhGhi chú
8 GB RAM, CPU1B-4BThử nghiệm
16 GB RAM, CPU4B-8BChậm hơn GPU
8 GB VRAM4B-8BDùng hàng ngày
12-16 GB VRAM8B-14BMáy trạm mạnh
24 GB VRAM14B-32BCao cấp
48 GB+32B-70BThử mô hình lớn

Tốc độ phụ thuộc kiến trúc, lượng tử hóa, ngữ cảnh, trình điều khiển và tác vụ khác.

Mô hình khởi đầu

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

nomic-embed-text dành cho embedding.

VRAM và RAM

Mô hình trong VRAM nhanh hơn. RAM cần cho CPU, offload và ngữ cảnh.

Apple Silicon

Dùng bộ nhớ thống nhất, chia sẻ với OS và ứng dụng.

NVIDIA

CUDA thường tương thích tốt nhất. Cập nhật trình điều khiển.

AMD và Intel

Phụ thuộc hỗ trợ Ollama; CPU luôn là phương án dự phòng.

Giảm bộ nhớ

  • Mô hình nhỏ
  • Q4 thay Q8
  • Ngữ cảnh ngắn
  • Gỡ mô hình không dùng

Dung lượng Work

Mỗi tác vụ mặc định:

  • 2 GB RAM;
  • 2 CPU;
  • 256 tiến trình.

Giới hạn mặc định hai tác vụ toàn instans và một mỗi admin. Ollama Cloud giảm bộ nhớ mô hình nhưng không bỏ Docker.

Mỗi tác vụ có volume không có hạn ngạch riêng. Theo dõi lưu trữ và sao lưu riêng.

Chỉ chỉnh WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT, WORK_MAX_ACTIVE_RUNTIMES_* sau khi đo host. Xem biến môi trường.

Tài liệu liên quan