Hardwareanforderungen
Die normale Chat-Oberfläche ist leichtgewichtig. Lokale Ollama-Modelle benötigen die meisten Ressourcen; Work-Container ergänzen CPU-, Speicher-, Prozess-, Image- und Projektspeicherbedarf.
Kurzreferenz
| Hardware | Praktische Modelle | Hinweise |
|---|---|---|
| 8 GB RAM, nur CPU | 1B-4B quantisiert | Tests und leichter Chat |
| 16 GB RAM, nur CPU | 4B-8B quantisiert | Nutzbar, langsamer als GPU |
| 8 GB VRAM | 4B-8B quantisiert | Gutes tägliches Setup |
| 12-16 GB VRAM | 8B-14B quantisiert | Starke Workstation |
| 24 GB VRAM | 14B-32B quantisiert | High-End lokal |
| 48 GB+ VRAM/großer Unified Memory | 32B-70B quantisiert | Große Modellexperimente |
Die Geschwindigkeit hängt von Architektur, Quantisierung, Kontext, Treibern und weiteren Prozessen ab.
Gute Einstiegsmodelle
ollama pull gemma4:12b
ollama pull qwen3.8:27b
ollama pull gemma4:26b
ollama pull nomic-embed-text
nomic-embed-text ist für Dokument-Embeddings, nicht für Chat.
VRAM und RAM
Passt das Modell in VRAM, antwortet es deutlich schneller. Auslagerung in System-RAM funktioniert möglicherweise, ist aber langsamer. RAM zählt außerdem für CPU-Inferenz, GPU-Offload, lange Kontexte und die Anwendung.
Apple Silicon
Unified Memory wird mit Betriebssystem und Anwendungen geteilt. Rechner mit mehr Unified Memory können größere quantisierte Modelle ausführen als ein System mit vergleichbarer diskreter VRAM-Angabe. Lass genügend Speicher frei.
NVIDIA
NVIDIA bietet über CUDA meist die beste Kompatibilität. Nutze aktuelle Treiber und prüfe Docker-GPU-Zugriff.
AMD und Intel
Die Unterstützung hängt von Ollama und Plattformtreibern ab; CPU-Inferenz bleibt verfügbar.
Speicherbedarf reduzieren
- Kleinere Modelle und Q4 statt Q8 verwenden.
- Kontext verkürzen.
- Ungenutzte Modelle entladen.
- Embedding- und Chatmodell getrennt wählen.
Work-Laufzeitkapazität
Jeder aktive Aufgabencontainer erhält standardmäßig:
- 2 GB Arbeitsspeicher;
- 2 CPUs; und
- 256 Prozesse.
Standardmäßig sind zwei aktive Containeraufgaben instanzweit und eine pro Administrator erlaubt. Das sind Limits, keine Reservierungen; plane WebUI, Browser, Docker, Ollama und Aufgabe gleichzeitig ein. Unter Apple Silicon teilen alle Unified Memory.
Remote-Modelle sparen Modell-RAM/VRAM, beseitigen aber weder Docker noch Containerressourcen. Jede Aufgabe besitzt ein Docker-Volume ohne eigenes Festplattenkontingent; Installationen können Docker-Speicher erschöpfen. Überwache ihn und sichere Volumes getrennt.
Ändere WORK_MEMORY_LIMIT, WORK_CPU_LIMIT, WORK_PIDS_LIMIT und WORK_MAX_ACTIVE_RUNTIMES_* erst nach Messung.
Siehe Umgebungsvariablen.