Ana içeriğe geç

Donanım Gereksinimleri

Libre WebUI’nin normal Chat arayüzü hafiftir. Kaynakların çoğunu yerel Ollama modelleri kullanır; kapsayıcı destekli Work görevleri ayrı CPU, bellek, işlem, görüntü ve proje depolama bütçesi ekler.

Hızlı Başvuru

DonanımPratik yerel modellerNotlar
8 GB RAM, yalnız CPUNicemlenmiş 1B-4BSınama ve hafif sohbet
16 GB RAM, yalnız CPUNicemlenmiş 4B-8BKullanılabilir, GPU’dan yavaş
8 GB VRAMNicemlenmiş 4B-8Bİyi günlük yerel kurulum
12-16 GB VRAMNicemlenmiş 8B-14BGüçlü iş istasyonu aralığı
24 GB VRAMNicemlenmiş 14B-32Bİleri yerel kullanım
48 GB+ VRAM veya büyük birleşik bellekNicemlenmiş 32B-70BBüyük model deneyleri

Gerçek hız model mimarisine, nicemlemeye, bağlam uzunluğuna, GPU sürücülerine ve diğer işlemlere bağlıdır.

İyi Başlangıç Modelleri

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

nomic-embed-text modelini sohbet modeli olarak değil, belge gömmeleri için kullanın.

VRAM ve RAM

VRAM, yerel model hızındaki en büyük etkendir. Model VRAM’e sığarsa yanıtlar çok daha hızlıdır. Sistem belleğine taşarsa çalışabilir ama yavaşlar.

Sistem belleği CPU çıkarımı, GPU dışa aktarma, uzun bağlam pencereleri ve uygulamanın geri kalanı için önemlidir.

Apple Silicon

Apple Silicon birleşik bellek kullanır; model belleği işletim sistemi ve uygulamalarla aynı havuzdadır. Büyük birleşik belleğe sahip bilgisayarlar, ayrık GPU sistemindeki VRAM sayısının düşündürdüğünden daha büyük nicemlenmiş modeller çalıştırabilir.

Tarayıcı, arka uç ve işletim sistemi için yeterli bellek bırakın.

NVIDIA

NVIDIA GPU’ları CUDA üzerinden genellikle en iyi yerel çıkarım uyumluluğunu sunar. Güncel sürücüler kullanın ve Ollama kapsayıcıdaysa Docker GPU erişimini doğrulayın.

AMD ve Intel

AMD ve Intel desteği, platformunuzdaki Ollama ve sürücülere bağlıdır. GPU hızlandırması yoksa CPU çıkarımı kullanılabilir.

Bellek Kullanımını Azaltma

  • Küçük modeller kullanın.
  • Q8 yerine Q4 nicemlemesi kullanın.
  • Bağlam uzunluğunu azaltın.
  • Kullanmadığınız modelleri çıkarın.
  • Belge gömme modelini sohbet modeli seçiminden ayırın.

Work Çalışma Zamanı Kapasitesi

Work, WebUI ve model işlemine ek kapsayıcı kaynakları kullanır. Her etkin görev kapsayıcısı varsayılan olarak:

  • 2 GB bellek;
  • 2 CPU; ve
  • 256 işlem alır.

Arka uç varsayılan olarak örnek genelinde iki etkin kapsayıcı görevi, yönetici başına bir görev kabul eder. Bunlar rezervasyon değil sınırdır ancak işletmeci WebUI arka ucunu, tarayıcıyı, Docker’ı, Ollama’yı ve görev kapsayıcısını aynı anda hesaba katmalıdır. Apple Silicon’da hepsi aynı birleşik bellek havuzu için yarışır.

Ollama Cloud veya yapılandırılmış uzak model eklentisi büyük modeli yerel RAM/VRAM’e yüklemeyi önleyebilir. Docker gereksinimini veya Work kapsayıcısı kaynaklarını kaldırmaz.

Her Work görevinin dosyalar ve yerel bağımlılıklar için adlı Docker birimi vardır. Görev başına disk kotası henüz yoktur; paket kurulumları veya projeler Docker depolamasını tüketebilir. Docker veri kökünü izleyin, varsa ana makine sınırları ayarlayın ve görev birimlerini Libre WebUI veritabanından ayrı yedekleyin.

WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT ve WORK_MAX_ACTIVE_RUNTIMES_* ayarlarını yalnızca arka uç ana makinesini ölçtükten sonra düzenleyin. Varsayılanlar için ortam değişkeni başvurusuna bakın.

İlgili Belgeler