Utvärderingar
Utvärderingsplattformen omvandlar vardaglig användning till jämförbara signaler om modellkvalitet: snabb återkoppling på enskilda svar, blinda dueller med Elo-topplista och återanvändbara utvärderingsuppsättningar vars körningar är reproducerbara beständiga jobb. Allt körs under din identitet och dina leverantörsuppgifter. Känsliga delar – ögonblicksbilder, kommentarer, uppsättningsprompter och körresultat – krypteras i vila.
Meddelandeåterkoppling
Ett betyg på ett assistentsvar lagrar mer än en tumme. En kompakt panel erbjuder ämnestaggar (korrekthet, stil, ofullständigt, skadligt, formatering) och en valfri kommentar. Libre tar en ögonblicksbild av den betygsatta växlingen – din prompt och svaret – så datapunkten överlever senare redigering eller radering av chatten. Det finns en återkopplingsrad per användare och meddelande; ett nytt betyg ersätter raden och borttagning av tummen raderar den. Din datamängd finns under Evaluations → Feedback; administratörer kan läsa hela installationens datamängd för kurering. Privata sessioner skapar aldrig återkopplingsrader.
Arena och topplista
En arenamatch skickar en prompt till två valda modeller och visar svaren i slumpad ordning. Modellernas identiteter förblir dolda tills rösten lagts – första, andra, oavgjort eller båda dåliga – och varje användare röstar en gång per match. Topplistan spelar upp varje röst i införandeordning genom en deterministisk Elo-beräkning (K=32, bas 1000), så en omräkning ger samma ställning. ”Båda dåliga” räknar deltagandet utan att ändra poängen.
Utvärderingsuppsättningar och körningar
En utvärderingsuppsättning är en namngiven lista med högst 50 prompter. Körning mot en modell utförs som ett beständigt jobb: varje prompt körs en i taget med dina uppgifter, förloppet visas, fel lagras per post i stället för att avbryta hela körningen och en avbruten körning markeras som avbruten. En slutförd körning lagrar exakt modell, alla utdata och latens per post krypterat, och kan exporteras som JSON för jämförelse sida vid sida eller regressionsspårning över modell-, prompt- eller leverantörsändringar.