Evaluierungen
Die Plattform macht tägliche Nutzung zu vergleichbaren Qualitätssignalen: Feedback zu Antworten, blinde Duelle mit Elo-Rangliste und wiederverwendbare Evaluierungssätze als reproduzierbare dauerhafte Jobs. Alles läuft unter deiner Identität und deinen Anbieterzugängen; Snapshots, Kommentare, Prompts und Ausgaben sind im Ruhezustand verschlüsselt.
Nachrichtenfeedback
Eine Bewertung bietet Themen wie Genauigkeit, Stil, unvollständig, schädlich und Formatierung sowie einen optionalen Kommentar. Libre speichert Prompt und Antwort, damit der Datenpunkt spätere Änderungen und Löschungen überlebt. Pro Benutzer und Nachricht existiert eine Zeile; Neubewertung ersetzt, Entfernen löscht. Deine Daten stehen unter Evaluierungen → Feedback; Administratoren können den instanzweiten Satz kuratieren. Private Sitzungen erzeugen nichts.
Arena und Rangliste
Ein Duell sendet einen Prompt an zwei Modelle und zeigt Antworten zufällig. Identitäten bleiben bis zur Stimme verborgen: erstes, zweites, unentschieden oder beide schlecht. Jeder stimmt einmal. Die Rangliste spielt Stimmen in Einfügereihenfolge mit deterministischem Elo (K=32, Basis 1000) ab; „beide schlecht“ zählt Teilnahme, ändert aber keine Wertung.
Evaluierungssätze und Läufe
Ein Satz enthält bis zu 50 Prompts. Ein Lauf ist ein dauerhafter Job: Er verarbeitet jeden Prompt einzeln mit deinen Zugängen, zeigt Fortschritt, speichert Fehler pro Element und lässt sich abbrechen. Abschließend speichert er exaktes Modell, Ausgaben und Latenz pro Element verschlüsselt und exportiert JSON für Vergleiche und Regressionen.