Μετάβαση στο κύριο περιεχόμενο

Αξιολογήσεις

Η πλατφόρμα αξιολόγησης μετατρέπει την καθημερινή χρήση σε συγκρίσιμα σήματα ποιότητας: γρήγορη ανατροφοδότηση σε απαντήσεις, τυφλές αναμετρήσεις με κατάταξη Elo και επαναχρησιμοποιήσιμα σύνολα αξιολόγησης ως αναπαραγώγιμα durable jobs. Όλα εκτελούνται με τη δική σας ταυτότητα και διαπιστευτήρια παρόχου. Snapshots, σχόλια, prompts συνόλων και outputs κρυπτογραφούνται σε αδράνεια.

Ανατροφοδότηση μηνυμάτων

Η βαθμολόγηση απάντησης καταγράφει περισσότερα από έναν αντίχειρα. Ένα μικρό panel προσφέρει tags (ακρίβεια, ύφος, ελλιπές, επιβλαβές, μορφοποίηση) και προαιρετικό σχόλιο. Το Libre κρατά snapshot της ανταλλαγής — prompt και απάντηση — ώστε το σημείο δεδομένων να επιβιώνει από μεταγενέστερη επεξεργασία ή διαγραφή chat. Υπάρχει μία γραμμή ανά χρήστη και μήνυμα· νέα βαθμολογία την αντικαθιστά και η εκκαθάριση την αφαιρεί. Τα δεδομένα σας βρίσκονται στο Evaluations → Feedback· οι διαχειριστές μπορούν να διαβάσουν το σύνολο της εγκατάστασης. Οι ιδιωτικές συνεδρίες δεν δημιουργούν γραμμές.

Αρένα και κατάταξη

Μια αναμέτρηση στέλνει ένα prompt σε δύο μοντέλα και εμφανίζει τις απαντήσεις με τυχαία σειρά. Οι ταυτότητες κρύβονται μέχρι την ψήφο — πρώτο, δεύτερο, ισοπαλία ή και τα δύο κακά — και κάθε χρήστης ψηφίζει μία φορά. Η κατάταξη αναπαράγει τις ψήφους με σειρά εισαγωγής μέσω ντετερμινιστικού Elo (K=32, βάση 1000), ώστε ο επανυπολογισμός να δίνει το ίδιο αποτέλεσμα. Το «και τα δύο κακά» μετρά συμμετοχή χωρίς αλλαγή rating.

Σύνολα και εκτελέσεις αξιολόγησης

Ένα σύνολο είναι ονομασμένη λίστα έως 50 prompts. Η εκτέλεση έναντι μοντέλου είναι durable job: κάθε prompt τρέχει διαδοχικά με τα διαπιστευτήριά σας, εμφανίζεται πρόοδος, τα σφάλματα καταγράφονται ανά στοιχείο αντί να διακόπτουν όλη την εκτέλεση και η ακύρωση τη σημειώνει ως ακυρωμένη. Μια ολοκληρωμένη εκτέλεση κρατά ακριβές μοντέλο, όλα τα outputs και latency ανά στοιχείο κρυπτογραφημένα και εξάγεται σε JSON για σύγκριση ή regression tracking μεταξύ αλλαγών μοντέλου, prompt ή παρόχου.