Donanım Gereksinimleri
Libre WebUI’nin normal Chat arayüzü hafiftir. Kaynakların çoğunu yerel Ollama modelleri kullanır; kapsayıcı destekli Work görevleri ayrı CPU, bellek, işlem, görüntü ve proje depolama bütçesi ekler.
Hızlı Başvuru
| Donanım | Pratik yerel modeller | Notlar |
|---|---|---|
| 8 GB RAM, yalnız CPU | Nicemlenmiş 1B-4B | Sınama ve hafif sohbet |
| 16 GB RAM, yalnız CPU | Nicemlenmiş 4B-8B | Kullanılabilir, GPU’dan yavaş |
| 8 GB VRAM | Nicemlenmiş 4B-8B | İyi günlük yerel kurulum |
| 12-16 GB VRAM | Nicemlenmiş 8B-14B | Güçlü iş istasyonu aralığı |
| 24 GB VRAM | Nicemlenmiş 14B-32B | İleri yerel kullanım |
| 48 GB+ VRAM veya büyük birleşik bellek | Nicemlenmiş 32B-70B | Büyük model deneyleri |
Gerçek hız model mimarisine, nicemlemeye, bağlam uzunluğuna, GPU sürücülerine ve diğer işlemlere bağlıdır.
İyi Başlangıç Modelleri
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
nomic-embed-text modelini sohbet modeli olarak değil, belge gömmeleri için kullanın.
VRAM ve RAM
VRAM, yerel model hızındaki en büyük etkendir. Model VRAM’e sığarsa yanıtlar çok daha hızlıdır. Sistem belleğine taşarsa çalışabilir ama yavaşlar.
Sistem belleği CPU çıkarımı, GPU dışa aktarma, uzun bağlam pencereleri ve uygulamanın geri kalanı için önemlidir.
Apple Silicon
Apple Silicon birleşik bellek kullanır; model belleği işletim sistemi ve uygulamalarla aynı havuzdadır. Büyük birleşik belleğe sahip bilgisayarlar, ayrık GPU sistemindeki VRAM sayısının düşündürdüğünden daha büyük nicemlenmiş modeller çalıştırabilir.
Tarayıcı, arka uç ve işletim sistemi için yeterli bellek bırakın.
NVIDIA
NVIDIA GPU’ları CUDA üzerinden genellikle en iyi yerel çıkarım uyumluluğunu sunar. Güncel sürücüler kullanın ve Ollama kapsayıcıdaysa Docker GPU erişimini doğrulayın.
AMD ve Intel
AMD ve Intel desteği, platformunuzdaki Ollama ve sürücülere bağlıdır. GPU hızlandırması yoksa CPU çıkarımı kullanılabilir.
Bellek Kullanımını Azaltma
- Küçük modeller kullanın.
- Q8 yerine Q4 nicemlemesi kullanın.
- Bağlam uzunluğunu azaltın.
- Kullanmadığınız modelleri çıkarın.
- Belge gömme modelini sohbet modeli seçiminden ayırın.
Work Çalışma Zamanı Kapasitesi
Work, WebUI ve model işlemine ek kapsayıcı kaynakları kullanır. Her etkin görev kapsayıcısı varsayılan olarak:
- 2 GB bellek;
- 2 CPU; ve
- 256 işlem alır.
Arka uç varsayılan olarak örnek genelinde iki etkin kapsayıcı görevi, yönetici başına bir görev kabul eder. Bunlar rezervasyon değil sınırdır ancak işletmeci WebUI arka ucunu, tarayıcıyı, Docker’ı, Ollama’yı ve görev kapsayıcısını aynı anda hesaba katmalıdır. Apple Silicon’da hepsi aynı birleşik bellek havuzu için yarışır.
Ollama Cloud veya yapılandırılmış uzak model eklentisi büyük modeli yerel RAM/VRAM’e yüklemeyi önleyebilir. Docker gereksinimini veya Work kapsayıcısı kaynaklarını kaldırmaz.
Her Work görevinin dosyalar ve yerel bağımlılıklar için adlı Docker birimi vardır. Görev başına disk kotası henüz yoktur; paket kurulumları veya projeler Docker depolamasını tüketebilir. Docker veri kökünü izleyin, varsa ana makine sınırları ayarlayın ve görev birimlerini Libre WebUI veritabanından ayrı yedekleyin.
WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT ve WORK_MAX_ACTIVE_RUNTIMES_* ayarlarını yalnızca arka uç ana makinesini ölçtükten sonra düzenleyin. Varsayılanlar için ortam değişkeni başvurusuna bakın.