Zum Hauptinhalt springen

Hardwareanforderungen

Die normale Chat-Oberfläche ist leichtgewichtig. Lokale Ollama-Modelle benötigen die meisten Ressourcen; Work-Container ergänzen CPU-, Speicher-, Prozess-, Image- und Projektspeicherbedarf.

Kurzreferenz

HardwarePraktische ModelleHinweise
8 GB RAM, nur CPU1B-4B quantisiertTests und leichter Chat
16 GB RAM, nur CPU4B-8B quantisiertNutzbar, langsamer als GPU
8 GB VRAM4B-8B quantisiertGutes tägliches Setup
12-16 GB VRAM8B-14B quantisiertStarke Workstation
24 GB VRAM14B-32B quantisiertHigh-End lokal
48 GB+ VRAM/großer Unified Memory32B-70B quantisiertGroße Modellexperimente

Die Geschwindigkeit hängt von Architektur, Quantisierung, Kontext, Treibern und weiteren Prozessen ab.

Gute Einstiegsmodelle

ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text

nomic-embed-text ist für Dokument-Embeddings, nicht für Chat.

VRAM und RAM

Passt das Modell in VRAM, antwortet es deutlich schneller. Auslagerung in System-RAM funktioniert möglicherweise, ist aber langsamer. RAM zählt außerdem für CPU-Inferenz, GPU-Offload, lange Kontexte und die Anwendung.

Apple Silicon

Unified Memory wird mit Betriebssystem und Anwendungen geteilt. Rechner mit mehr Unified Memory können größere quantisierte Modelle ausführen als ein System mit vergleichbarer diskreter VRAM-Angabe. Lass genügend Speicher frei.

NVIDIA

NVIDIA bietet über CUDA meist die beste Kompatibilität. Nutze aktuelle Treiber und prüfe Docker-GPU-Zugriff.

AMD und Intel

Die Unterstützung hängt von Ollama und Plattformtreibern ab; CPU-Inferenz bleibt verfügbar.

Speicherbedarf reduzieren

  • Kleinere Modelle und Q4 statt Q8 verwenden.
  • Kontext verkürzen.
  • Ungenutzte Modelle entladen.
  • Embedding- und Chatmodell getrennt wählen.

Work-Laufzeitkapazität

Jeder aktive Aufgabencontainer erhält standardmäßig:

  • 2 GB Arbeitsspeicher;
  • 2 CPUs; und
  • 256 Prozesse.

Standardmäßig sind zwei aktive Containeraufgaben instanzweit und eine pro Administrator erlaubt. Das sind Limits, keine Reservierungen; plane WebUI, Browser, Docker, Ollama und Aufgabe gleichzeitig ein. Unter Apple Silicon teilen alle Unified Memory.

Remote-Modelle sparen Modell-RAM/VRAM, beseitigen aber weder Docker noch Containerressourcen. Jede Aufgabe besitzt ein Docker-Volume ohne eigenes Festplattenkontingent; Installationen können Docker-Speicher erschöpfen. Überwache ihn und sichere Volumes getrennt.

Ändere WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT und WORK_MAX_ACTIVE_RUNTIMES_* erst nach Messung. Siehe Umgebungsvariablen.

Verwandte Dokumentation