Persyaratan Perangkat Keras
Antarmuka Chat Libre WebUI ringan. Sebagian besar sumber daya dipakai model Ollama lokal; tugas Work menambah anggaran CPU, memori, proses, image, dan penyimpanan proyek.
Referensi Cepat
| Perangkat keras | Model lokal praktis | Catatan |
|---|---|---|
| 8 GB RAM, CPU saja | 1B-4B terkuantisasi | Tes dan chat ringan |
| 16 GB RAM, CPU saja | 4B-8B terkuantisasi | Dapat dipakai, lebih lambat dari GPU |
| 8 GB VRAM | 4B-8B terkuantisasi | Penyiapan harian bagus |
| 12-16 GB VRAM | 8B-14B terkuantisasi | Stasiun kerja kuat |
| 24 GB VRAM | 14B-32B terkuantisasi | Penggunaan lokal tingkat tinggi |
| 48 GB+ VRAM atau memori terpadu besar | 32B-70B terkuantisasi | Eksperimen model besar |
Kecepatan bergantung pada arsitektur, kuantisasi, konteks, penggerak GPU, dan proses lain.
Model Awal yang Baik
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
Gunakan nomic-embed-text untuk embedding dokumen, bukan chat.
VRAM dan RAM
VRAM adalah faktor utama kecepatan lokal. Jika model muat di VRAM, jawaban jauh lebih cepat. Jika tumpah ke RAM, model tetap dapat berjalan tetapi lambat.
RAM penting untuk inferensi CPU, pemindahan GPU, konteks panjang, dan aplikasi lain.
Apple Silicon
Apple Silicon memakai memori terpadu; model berbagi kumpulan dengan OS dan aplikasi. Komputer dengan memori besar dapat menjalankan model lebih besar daripada angka VRAM GPU diskret.
Sisakan memori untuk peramban, backend, dan OS.
NVIDIA
GPU NVIDIA umumnya memberi kompatibilitas terbaik melalui CUDA. Gunakan penggerak terbaru dan verifikasi akses GPU Docker jika Ollama dalam kontainer.
AMD dan Intel
Dukungan bergantung pada Ollama dan penggerak platform. Inferensi CPU tetap tersedia.
Mengurangi Memori
- Gunakan model kecil.
- Gunakan Q4, bukan Q8.
- Kurangi konteks.
- Keluarkan model tidak terpakai.
- Pisahkan model embedding dari model chat.
Kapasitas Runtime Work
Work menambah sumber daya kontainer. Setiap kontainer aktif mendapat:
- 2 GB memori;
- 2 CPU; dan
- 256 proses.
Backend mengizinkan dua tugas aktif per instans dan satu per administrator. Ini batas, bukan reservasi; hitung WebUI, peramban, Docker, Ollama, dan tugas bersama. Apple Silicon berbagi satu kumpulan memori.
Ollama Cloud atau plugin jarak jauh menghindari pemuatan model besar ke RAM/VRAM lokal, tetapi tidak menghapus Docker atau sumber daya tugas.
Setiap tugas punya volume Docker untuk berkas dan dependensi. Belum ada kuota disk per tugas; paket dapat memenuhi penyimpanan. Pantau akar data Docker dan cadangkan volume terpisah dari basis data.
Sesuaikan WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT, WORK_MAX_ACTIVE_RUNTIMES_* setelah mengukur host. Nilai bawaan ada di referensi lingkungan.