Mit KI-Modellen arbeiten
Libre WebUI kann lokale Ollama-Modelle und cloudbasierte Modelle aus Plugins im selben Arbeitsbereich verwenden. Der Modellmanager zeigt installierte und laufende Ollama-Modelle, Live-Ergebnisse der Ollama Library, GGUF-Einträge von Hugging Face und verfügbare Ollama Cloud-Einträge.
Ein erstes Modell auswählen
Nutze diese als Ausgangspunkte und wechsle je nach Hardware und Aufgabe:
| Modell | Geeignet für | Typische Ausstattung |
|---|---|---|
gemma4:12b | Schneller allgemeiner Chat | 16 GB RAM oder 8 GB VRAM |
qwen3.8:27b | Chat, Programmierung, mehrere Sprachen | 32 GB RAM oder 16-24 GB VRAM |
gemma4:26b | Starker Chat mit MoE-Effizienz | 24 GB RAM oder 16 GB VRAM |
gemma4:31b | Hochwertigster dichter lokaler Chat | 32 GB RAM oder 24 GB VRAM |
nomic-embed-text | Dokument-Embeddings | Kleines lokales Modell |
Große Modelle wie 30B, 70B und MoE können hervorragend sein, brauchen aber deutlich mehr Speicher. Beginne im Zweifel klein und steigere erst nach stabilem Betrieb.
Modellmanager
Öffne Einstellungen → Modelle, um:
- Ollama-Modelle nach Namen abzurufen.
- Die Ollama Library live statt einer statischen Liste zu durchsuchen.
- Installierte und laufende Modelle anzuzeigen.
- Alle installierten Ollama-Modelle in einem Vorgang zu aktualisieren.
- Laufende Modelle zu stoppen oder zu entladen.
- Nicht mehr benötigte Modelle zu löschen.
- Kompatible Hugging Face-GGUF-Modelle über Ollama abzurufen.
- Ollama Cloud-Modelle über den Cloud-Filter abzurufen.
Bei Ollama Cloud normalisiert die Oberfläche Namen vor dem Abruf. Benötigt ein
Modell :cloud oder -cloud, wendet Libre WebUI das im Cloud-Ablauf an.
Modellkatalog und Sichtbarkeit
Der Modellkatalog unter Einstellungen → Standardwerte listet alle auswählbaren Chatmodelle, lokal und anbieterbasiert, mit Anbieterabzeichen und Suche. Das Standardmodell oberhalb des Katalogs bestimmt das Startmodell neuer Chats.
Administratoren können ein Modell mit einem Stern versehen, damit es oben im Katalog und im Standardmodell-Menü erscheint. Bei mehreren Sternen steht das zuletzt markierte Modell vorn; ohne Stern kehrt ein Modell auf seine manuelle oder anbieterseitige Position zurück.
Administratoren können Modelle über ein Augensymbol für andere Auswahlfelder ausblenden. Das verkürzt lange Kataloge auf gewünschte Modelle, ist aber nur Kuratierung und keine Autorisierungsgrenze. Administratoren sehen stets die vollständige Liste und Markierungen ausgeblendeter Modelle.
Lokale und Cloud-Modelle
| Modus | Vorteile | Nachteile |
|---|---|---|
| Lokales Ollama | Privat, nach Download offline, vorhersehbare Kosten | Abhängig von CPU, GPU und RAM |
| Ollama Cloud | Vertrauter Ollama-Ablauf ohne lokale Hardwaregrenzen | Erfordert Cloud- und Netzwerkzugriff |
| Anbieter-Plugins | Verwaltete Modelle mehrerer Anbieter | API-Schlüssel, Preise und Datenschutzrichtlinien gelten |
Du kannst lokale Modelle für private Arbeit behalten und Plugins für Aufgaben mit größeren gehosteten Modellen aktivieren.
Standardmäßiges Vision-Modell
Du kannst mit einem schnellen Textmodell chatten und dennoch Bilder senden. Wähle unter Einstellungen → Standardwerte → Spezialisierte Modelle → Vision-Modell ein Modell. Enthält der ausgehende Kontext Bilder – neuer Anhang, früheres Bild oder Verlauf eines Inkognito-Chats –, wird diese Runde statt zum Sitzungsmodell dorthin geleitet. Nur-Text-Runden bleiben beim Sitzungsmodell.
Die Einstellung gilt pro Benutzer, Routing ist automatisch und still. Aktuelles Chatmodell verwenden deaktiviert sie. Geprüft wird das Vorhandensein von Bildern, nicht die Fähigkeit des Sitzungsmodells: Bei konfiguriertem Vision-Modell nutzt jede bildhaltige Runde dieses Modell.
Die Auswahl speichert die genaue Anbieteridentität (Ollama oder bestimmtes Plugin) mit dem Namen, damit kein Anbieter ein gleichnamiges Modell übernehmen kann. Geht diese Identität verloren, schlägt eine Bildrunde fehl. Wähle das Modell unter Einstellungen → Standardwerte → Spezialisierte Modelle → Vision-Modell erneut aus, um das zu reparieren. Das deutliche Scheitern ist beabsichtigt; Libre WebUI ersetzt keinen Anbieter stillschweigend.
Modelle für Work
Work braucht ein Chatmodell mit Werkzeugaufrufen. Möglich sind:
- Ein installiertes Ollama-Modell mit Fähigkeit
tools. - Ein Ollama Cloud-Modell am konfigurierten Ollama-Endpunkt.
- Ein Modell eines aktiven Chat-/Vervollständigungs-Plugins mit Anmeldedaten für den aktuellen Administrator.
Pluginbasierte Ausführungen nutzen den passenden Adapter: OpenAI-kompatibel, Anthropic oder Gemini. Libre WebUI speichert Anbietertyp und Plugin-ID mit Aufgabe und Ausführung, damit kein gleichnamiges Ollama-Modell übernommen wird. Lehnt das Modell Werkzeugaufrufe ab, schlägt die Ausführung ohne stillen Wechsel fehl.
Lokales Ollama hält Anfragen auf der konfigurierten Infrastruktur. Bei Remote- Modellen erhält der Anbieter Work-System-Prompt, Unterhaltung, Werkzeugdefinitionen und Ergebnisse. Diese können Quelltext, Befehlsausgabe oder Verzeichnislisten enthalten. Volumes und Anmeldedaten bleiben auf dem Backend-Host; Dateiinhalte können ihn verlassen, wenn ein Werkzeug sie zurückgibt.
Eine autonome Work-Ausführung kann viele Modellaufrufe machen. Prüfe Preise, Aufbewahrung und Training des Remote-Anbieters vor sensiblen Projekten. Libre WebUI zeigt in Work einen benutzerspezifisch verwerfbaren Hinweis.
Hardwareleitfaden
| System | Praktischer Bereich | Hinweise |
|---|---|---|
| Nur CPU, 8-16 GB RAM | 1B-4B | Leichter Chat und Tests |
| 8 GB VRAM | 4B-8B quantisiert | Bequemer Ausgangspunkt |
| 12-16 GB VRAM | 8B-14B quantisiert | Guter Alltagsbereich |
| 24 GB VRAM | 14B-32B quantisiert | Starke lokale Workstation |
| 48 GB+ VRAM oder großer Unified Memory | 32B-70B quantisiert | Experimente mit großen Modellen |
Quantisierte Modelle brauchen weniger Speicher. Q4 ist meist der praktische Standard, Q8 braucht mehr Speicher für bessere Qualität.
Empfehlungen nach Aufgabe
| Aufgabe | Modellrichtung |
|---|---|
| Schneller Chat | gemma4:12b und andere kleine aktuelle Modelle |
| Programmierung | Qwen Coder, Codestral, Programmiermodelle von Anbietern |
| Schlussfolgern | Größere Qwen-/Gemma- und Schlussfolgerungsmodelle von Anbietern |
| Vision | Multimodale Modelle wie LLaVA, Qwen VL oder Anbietermodelle |
| Dokumentensuche | nomic-embed-text oder anderes Embedding-Modell |
| Text-zu-Sprache | TTS-Plugins wie Qwen3-TTS oder Kyutai TTS |
Anbieternamen ändern sich häufig. Nutze die Modellerkennung oder kopiere die genaue ID aus dem Anbieter-Dashboard.
Prompts und Einstellungen
- Generierungssteuerung wie Temperatur, Tokenlimits, Kontextlänge und Strafen liegt unter Erweiterte Generierungseinstellungen und ist standardmäßig geschlossen.
- Niedrige Temperatur (
0.1-0.3) für sachliche, wiederholbare Antworten. - Mittlere Temperatur (
0.5-0.7) für normale Assistentenarbeit. - Höhere Temperatur (
0.8+) für Ideenfindung und kreatives Schreiben. - Halte die Kontextlänge nahe Speichergrenzen angemessen.
- Nutze Personas für dauerhafte Parameter und wiederverwendbare System-Prompts.
Fehlerbehebung
Abruf schlägt fehl
- Prüfe Ollama:
ollama list. - Teste denselben Abruf im Terminal für die Originalfehlermeldung.
- Prüfe Speicherplatz vor großen Modellen.
- Lass Libre WebUI bei Nutzung des Cloud-Filters die Suffixe verwalten.
Langsame Antworten
- Nutze ein kleineres Modell oder niedrigere Quantisierung.
- Prüfe Geladenes mit
ollama ps. - Schließe GPU-intensive Anwendungen.
- Reduziere die Kontextlänge.
Zu wenig Speicher
- Wechsle von Q8 zu Q4.
- Nutze 8B statt 14B.
- Halte nur das benötigte Modell geladen.
- Prüfe in Docker den GPU- oder Host-Ollama-Zugriff.