Ga naar hoofdinhoud

Evaluaties

Het evaluatieplatform zet dagelijks gebruik om in vergelijkbare signalen voor modelkwaliteit: snelle feedback op afzonderlijke antwoorden, blinde rechtstreekse arenawedstrijden met een Elo-klassement en herbruikbare evaluatieverzamelingen waarvan de uitvoeringen reproduceerbare duurzame taken zijn. Alles wordt uitgevoerd onder uw eigen identiteit en providerreferenties. De gevoelige onderdelen — momentopnamen, opmerkingen, verzamelingsprompts en uitvoer van runs — worden versleuteld opgeslagen.

Feedback op berichten

Een antwoord van een assistent beoordelen legt meer vast dan een duim: een compact paneel biedt onderwerptags (nauwkeurigheid, stijl, onvolledig, schadelijk, opmaak) en een optionele opmerking. Libre maakt een momentopname van de beoordeelde uitwisseling — uw prompt en het antwoord — zodat het gegevenspunt latere bewerkingen en verwijderingen van de chat overleeft. Per gebruiker en bericht bestaat één feedbackrij; opnieuw beoordelen vervangt die en de duim wissen verwijdert haar. Uw gegevensverzameling staat onder Evaluations → Feedback; beheerders kunnen de gegevensverzameling van de hele instantie voor beheer lezen. Privésessies produceren nooit feedbackrijen.

Arena en klassement

Een arenawedstrijd stuurt één prompt naar twee door u gekozen modellen en toont beide antwoorden in willekeurige volgorde. Modelidentiteiten blijven verborgen totdat de stem is uitgebracht — eerste, tweede, gelijkspel of beide slecht — en elke gebruiker stemt eenmaal per wedstrijd. Het klassement speelt elke stem in invoegvolgorde opnieuw af via een deterministische Elo-rating (K=32, basis 1000), zodat herberekenen altijd dezelfde stand oplevert; "beide slecht" telt als deelname zonder ratings te veranderen.

Evaluatieverzamelingen en uitvoeringen

Een evaluatieverzameling is een benoemde lijst van maximaal 50 prompts. Een verzameling tegen een model uitvoeren gebeurt als duurzame taak: elke prompt wordt één voor één onder uw referenties uitgevoerd, de voortgang is tijdens de uitvoering zichtbaar, fouten worden per item vastgelegd in plaats van de uitvoering af te breken en annuleren markeert de uitvoering als geannuleerd. Een voltooide uitvoering bewaart het exacte model, elke uitvoer en de latentie per item — versleuteld — en kan als JSON worden geëxporteerd voor directe vergelijking of het volgen van regressies bij wijzigingen aan model, prompt of provider.