Zum Hauptinhalt springen

Mit KI-Modellen arbeiten

Libre WebUI kann lokale Ollama-Modelle und cloudbasierte Modelle aus Plugins im selben Arbeitsbereich verwenden. Der Modellmanager zeigt installierte und laufende Ollama-Modelle, Live-Ergebnisse der Ollama Library, GGUF-Einträge von Hugging Face und verfügbare Ollama Cloud-Einträge.

Ein erstes Modell auswählen

Nutze diese als Ausgangspunkte und wechsle je nach Hardware und Aufgabe:

ModellGeeignet fürTypische Ausstattung
gemma4:12bSchneller allgemeiner Chat16 GB RAM oder 8 GB VRAM
qwen3.8:27bChat, Programmierung, mehrere Sprachen32 GB RAM oder 16-24 GB VRAM
gemma4:26bStarker Chat mit MoE-Effizienz24 GB RAM oder 16 GB VRAM
gemma4:31bHochwertigster dichter lokaler Chat32 GB RAM oder 24 GB VRAM
nomic-embed-textDokument-EmbeddingsKleines lokales Modell

Große Modelle wie 30B, 70B und MoE können hervorragend sein, brauchen aber deutlich mehr Speicher. Beginne im Zweifel klein und steigere erst nach stabilem Betrieb.

Modellmanager

Öffne Einstellungen → Modelle, um:

  • Ollama-Modelle nach Namen abzurufen.
  • Die Ollama Library live statt einer statischen Liste zu durchsuchen.
  • Installierte und laufende Modelle anzuzeigen.
  • Alle installierten Ollama-Modelle in einem Vorgang zu aktualisieren.
  • Laufende Modelle zu stoppen oder zu entladen.
  • Nicht mehr benötigte Modelle zu löschen.
  • Kompatible Hugging Face-GGUF-Modelle über Ollama abzurufen.
  • Ollama Cloud-Modelle über den Cloud-Filter abzurufen.

Bei Ollama Cloud normalisiert die Oberfläche Namen vor dem Abruf. Benötigt ein Modell :cloud oder -cloud, wendet Libre WebUI das im Cloud-Ablauf an.

Modellkatalog und Sichtbarkeit

Der Modellkatalog unter Einstellungen → Standardwerte listet alle auswählbaren Chatmodelle, lokal und anbieterbasiert, mit Anbieterabzeichen und Suche. Das Standardmodell oberhalb des Katalogs bestimmt das Startmodell neuer Chats.

Administratoren können ein Modell mit einem Stern versehen, damit es oben im Katalog und im Standardmodell-Menü erscheint. Bei mehreren Sternen steht das zuletzt markierte Modell vorn; ohne Stern kehrt ein Modell auf seine manuelle oder anbieterseitige Position zurück.

Administratoren können Modelle über ein Augensymbol für andere Auswahlfelder ausblenden. Das verkürzt lange Kataloge auf gewünschte Modelle, ist aber nur Kuratierung und keine Autorisierungsgrenze. Administratoren sehen stets die vollständige Liste und Markierungen ausgeblendeter Modelle.

Lokale und Cloud-Modelle

ModusVorteileNachteile
Lokales OllamaPrivat, nach Download offline, vorhersehbare KostenAbhängig von CPU, GPU und RAM
Ollama CloudVertrauter Ollama-Ablauf ohne lokale HardwaregrenzenErfordert Cloud- und Netzwerkzugriff
Anbieter-PluginsVerwaltete Modelle mehrerer AnbieterAPI-Schlüssel, Preise und Datenschutzrichtlinien gelten

Du kannst lokale Modelle für private Arbeit behalten und Plugins für Aufgaben mit größeren gehosteten Modellen aktivieren.

Standardmäßiges Vision-Modell

Du kannst mit einem schnellen Textmodell chatten und dennoch Bilder senden. Wähle unter Einstellungen → Standardwerte → Spezialisierte Modelle → Vision-Modell ein Modell. Enthält der ausgehende Kontext Bilder – neuer Anhang, früheres Bild oder Verlauf eines Inkognito-Chats –, wird diese Runde statt zum Sitzungsmodell dorthin geleitet. Nur-Text-Runden bleiben beim Sitzungsmodell.

Die Einstellung gilt pro Benutzer, Routing ist automatisch und still. Aktuelles Chatmodell verwenden deaktiviert sie. Geprüft wird das Vorhandensein von Bildern, nicht die Fähigkeit des Sitzungsmodells: Bei konfiguriertem Vision-Modell nutzt jede bildhaltige Runde dieses Modell.

Die Auswahl speichert die genaue Anbieteridentität (Ollama oder bestimmtes Plugin) mit dem Namen, damit kein Anbieter ein gleichnamiges Modell übernehmen kann. Geht diese Identität verloren, schlägt eine Bildrunde fehl. Wähle das Modell unter Einstellungen → Standardwerte → Spezialisierte Modelle → Vision-Modell erneut aus, um das zu reparieren. Das deutliche Scheitern ist beabsichtigt; Libre WebUI ersetzt keinen Anbieter stillschweigend.

Modelle für Work

Work braucht ein Chatmodell mit Werkzeugaufrufen. Möglich sind:

  • Ein installiertes Ollama-Modell mit Fähigkeit tools.
  • Ein Ollama Cloud-Modell am konfigurierten Ollama-Endpunkt.
  • Ein Modell eines aktiven Chat-/Vervollständigungs-Plugins mit Anmeldedaten für den aktuellen Administrator.

Pluginbasierte Ausführungen nutzen den passenden Adapter: OpenAI-kompatibel, Anthropic oder Gemini. Libre WebUI speichert Anbietertyp und Plugin-ID mit Aufgabe und Ausführung, damit kein gleichnamiges Ollama-Modell übernommen wird. Lehnt das Modell Werkzeugaufrufe ab, schlägt die Ausführung ohne stillen Wechsel fehl.

Lokales Ollama hält Anfragen auf der konfigurierten Infrastruktur. Bei Remote- Modellen erhält der Anbieter Work-System-Prompt, Unterhaltung, Werkzeugdefinitionen und Ergebnisse. Diese können Quelltext, Befehlsausgabe oder Verzeichnislisten enthalten. Volumes und Anmeldedaten bleiben auf dem Backend-Host; Dateiinhalte können ihn verlassen, wenn ein Werkzeug sie zurückgibt.

Eine autonome Work-Ausführung kann viele Modellaufrufe machen. Prüfe Preise, Aufbewahrung und Training des Remote-Anbieters vor sensiblen Projekten. Libre WebUI zeigt in Work einen benutzerspezifisch verwerfbaren Hinweis.

Hardwareleitfaden

SystemPraktischer BereichHinweise
Nur CPU, 8-16 GB RAM1B-4BLeichter Chat und Tests
8 GB VRAM4B-8B quantisiertBequemer Ausgangspunkt
12-16 GB VRAM8B-14B quantisiertGuter Alltagsbereich
24 GB VRAM14B-32B quantisiertStarke lokale Workstation
48 GB+ VRAM oder großer Unified Memory32B-70B quantisiertExperimente mit großen Modellen

Quantisierte Modelle brauchen weniger Speicher. Q4 ist meist der praktische Standard, Q8 braucht mehr Speicher für bessere Qualität.

Empfehlungen nach Aufgabe

AufgabeModellrichtung
Schneller Chatgemma4:12b und andere kleine aktuelle Modelle
ProgrammierungQwen Coder, Codestral, Programmiermodelle von Anbietern
SchlussfolgernGrößere Qwen-/Gemma- und Schlussfolgerungsmodelle von Anbietern
VisionMultimodale Modelle wie LLaVA, Qwen VL oder Anbietermodelle
Dokumentensuchenomic-embed-text oder anderes Embedding-Modell
Text-zu-SpracheTTS-Plugins wie Qwen3-TTS oder Kyutai TTS

Anbieternamen ändern sich häufig. Nutze die Modellerkennung oder kopiere die genaue ID aus dem Anbieter-Dashboard.

Prompts und Einstellungen

  • Generierungssteuerung wie Temperatur, Tokenlimits, Kontextlänge und Strafen liegt unter Erweiterte Generierungseinstellungen und ist standardmäßig geschlossen.
  • Niedrige Temperatur (0.1-0.3) für sachliche, wiederholbare Antworten.
  • Mittlere Temperatur (0.5-0.7) für normale Assistentenarbeit.
  • Höhere Temperatur (0.8+) für Ideenfindung und kreatives Schreiben.
  • Halte die Kontextlänge nahe Speichergrenzen angemessen.
  • Nutze Personas für dauerhafte Parameter und wiederverwendbare System-Prompts.

Fehlerbehebung

Abruf schlägt fehl

  • Prüfe Ollama: ollama list.
  • Teste denselben Abruf im Terminal für die Originalfehlermeldung.
  • Prüfe Speicherplatz vor großen Modellen.
  • Lass Libre WebUI bei Nutzung des Cloud-Filters die Suffixe verwalten.

Langsame Antworten

  • Nutze ein kleineres Modell oder niedrigere Quantisierung.
  • Prüfe Geladenes mit ollama ps.
  • Schließe GPU-intensive Anwendungen.
  • Reduziere die Kontextlänge.

Zu wenig Speicher

  • Wechsle von Q8 zu Q4.
  • Nutze 8B statt 14B.
  • Halte nur das benötigte Modell geladen.
  • Prüfe in Docker den GPU- oder Host-Ollama-Zugriff.

Verwandte Dokumentation