Passa al contenuto principale

Valutazioni

La piattaforma di valutazione trasforma l'uso quotidiano in indicatori comparabili della qualità dei modelli: feedback rapido su singole risposte, scontri anonimi uno contro uno in un'arena con classifica Elo e insiemi di valutazione riutilizzabili, le cui esecuzioni sono job duraturi e riproducibili. Tutto avviene con la tua identità e le tue credenziali dei provider, mentre le parti sensibili — istantanee, commenti, prompt degli insiemi e output delle esecuzioni — sono cifrate a riposo.

Feedback sui messaggi

La valutazione della risposta di un assistente registra più di un pollice: un pannello compatto propone tag di argomento (precisione, stile, incompletezza, contenuto dannoso, formattazione) e un commento facoltativo; Libre crea un'istantanea dello scambio valutato — il tuo prompt e la risposta — così il dato sopravvive a successive modifiche ed eliminazioni della chat. Esiste una riga di feedback per utente e messaggio; una nuova valutazione la sostituisce, mentre la rimozione del pollice la elimina. Il tuo set di dati si trova in Valutazioni → Feedback; gli amministratori possono leggere il set di dati dell'intera istanza per la curatela. Le sessioni private non producono mai righe di feedback.

Arena e classifica

Una sfida nell'arena invia un prompt a due modelli a tua scelta e mostra entrambe le risposte in ordine casuale. Le identità dei modelli restano nascoste fino al voto — primo, secondo, pareggio o entrambi scadenti — e ogni utente vota una sola volta per sfida. La classifica riproduce ogni voto nell'ordine di inserimento con un punteggio Elo deterministico (K=32, base 1000), quindi un nuovo calcolo produce sempre la stessa graduatoria; "entrambi scadenti" conta come partecipazione senza modificare i punteggi.

Insiemi ed esecuzioni di valutazione

Un insieme di valutazione è un elenco denominato contenente fino a 50 prompt. L'esecuzione di un insieme su un modello avviene come job duraturo: ogni prompt viene eseguito singolarmente con le tue credenziali, l'avanzamento è visibile durante l'esecuzione, gli errori vengono registrati per elemento anziché interrompere l'intera esecuzione e l'annullamento contrassegna l'esecuzione come annullata. Un'esecuzione completata archivia il modello esatto, ogni output e la latenza per elemento — in forma cifrata — e viene esportata come JSON per confronti affiancati o per monitorare regressioni tra modifiche a modello, prompt o provider.