Lewati ke konten utama

Persyaratan Perangkat Keras

Antarmuka Chat Libre WebUI ringan. Sebagian besar sumber daya dipakai model Ollama lokal; tugas Work menambah anggaran CPU, memori, proses, image, dan penyimpanan proyek.

Referensi Cepat

Perangkat kerasModel lokal praktisCatatan
8 GB RAM, CPU saja1B-4B terkuantisasiTes dan chat ringan
16 GB RAM, CPU saja4B-8B terkuantisasiDapat dipakai, lebih lambat dari GPU
8 GB VRAM4B-8B terkuantisasiPenyiapan harian bagus
12-16 GB VRAM8B-14B terkuantisasiStasiun kerja kuat
24 GB VRAM14B-32B terkuantisasiPenggunaan lokal tingkat tinggi
48 GB+ VRAM atau memori terpadu besar32B-70B terkuantisasiEksperimen model besar

Kecepatan bergantung pada arsitektur, kuantisasi, konteks, penggerak GPU, dan proses lain.

Model Awal yang Baik

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

Gunakan nomic-embed-text untuk embedding dokumen, bukan chat.

VRAM dan RAM

VRAM adalah faktor utama kecepatan lokal. Jika model muat di VRAM, jawaban jauh lebih cepat. Jika tumpah ke RAM, model tetap dapat berjalan tetapi lambat.

RAM penting untuk inferensi CPU, pemindahan GPU, konteks panjang, dan aplikasi lain.

Apple Silicon

Apple Silicon memakai memori terpadu; model berbagi kumpulan dengan OS dan aplikasi. Komputer dengan memori besar dapat menjalankan model lebih besar daripada angka VRAM GPU diskret.

Sisakan memori untuk peramban, backend, dan OS.

NVIDIA

GPU NVIDIA umumnya memberi kompatibilitas terbaik melalui CUDA. Gunakan penggerak terbaru dan verifikasi akses GPU Docker jika Ollama dalam kontainer.

AMD dan Intel

Dukungan bergantung pada Ollama dan penggerak platform. Inferensi CPU tetap tersedia.

Mengurangi Memori

  • Gunakan model kecil.
  • Gunakan Q4, bukan Q8.
  • Kurangi konteks.
  • Keluarkan model tidak terpakai.
  • Pisahkan model embedding dari model chat.

Kapasitas Runtime Work

Work menambah sumber daya kontainer. Setiap kontainer aktif mendapat:

  • 2 GB memori;
  • 2 CPU; dan
  • 256 proses.

Backend mengizinkan dua tugas aktif per instans dan satu per administrator. Ini batas, bukan reservasi; hitung WebUI, peramban, Docker, Ollama, dan tugas bersama. Apple Silicon berbagi satu kumpulan memori.

Ollama Cloud atau plugin jarak jauh menghindari pemuatan model besar ke RAM/VRAM lokal, tetapi tidak menghapus Docker atau sumber daya tugas.

Setiap tugas punya volume Docker untuk berkas dan dependensi. Belum ada kuota disk per tugas; paket dapat memenuhi penyimpanan. Pantau akar data Docker dan cadangkan volume terpisah dari basis data.

Sesuaikan WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT, WORK_MAX_ACTIVE_RUNTIMES_* setelah mengukur host. Nilai bawaan ada di referensi lingkungan.

Dokumentasi Terkait