Ewaluacje
Platforma ewaluacji zamienia codzienne użycie w porównywalne sygnały jakości modeli: szybkie opinie o pojedynczych odpowiedziach, ślepe bezpośrednie pojedynki na arenie z tabelą Elo oraz wielokrotnego użytku zestawy ewaluacyjne, których wykonania są odtwarzalnymi trwałymi zadaniami. Wszystko działa pod Twoją tożsamością i poświadczeniami dostawców, a elementy wrażliwe — migawki, komentarze, prompty zestawów i wyniki wykonań — są zaszyfrowane w spoczynku.
Opinie o wiadomościach
Ocena odpowiedzi asystenta zapisuje więcej niż kciuk: mały panel oferuje tagi tematyczne (dokładność, styl, niekompletność, szkodliwość, formatowanie) i opcjonalny komentarz, a Libre tworzy migawkę ocenionej wymiany — Twojego promptu i odpowiedzi — aby punkt danych przetrwał późniejsze edycje lub usunięcia czatu. Na użytkownika i wiadomość istnieje jeden rekord opinii; ponowna ocena go zastępuje, a usunięcie kciuka kasuje. Twój zestaw danych znajduje się w Evaluations → Feedback; administratorzy mogą odczytać zestaw całej instancji do kuracji. Sesje prywatne nigdy nie tworzą rekordów opinii.
Arena i tabela wyników
Pojedynek na arenie wysyła jeden prompt do dwóch wybranych modeli i pokazuje obie odpowiedzi w losowej kolejności. Tożsamości modeli pozostają ukryte do oddania głosu — pierwszy, drugi, remis lub oba złe — a użytkownik głosuje raz na pojedynek. Tabela odtwarza każdy głos w kolejności wstawienia przez deterministyczny ranking Elo (K=32, baza 1000), więc ponowne obliczenie zawsze daje tę samą kolejność; „oba złe” zalicza udział bez zmiany ocen.
Zestawy i wykonania ewaluacji
Zestaw ewaluacyjny to nazwana lista maksymalnie 50 promptów. Uruchomienie zestawu na modelu jest trwałym zadaniem: każdy prompt wykonuje się kolejno z Twoimi poświadczeniami, postęp jest widoczny, błędy są rejestrowane osobno zamiast przerywać całość, a anulowanie oznacza wykonanie jako anulowane. Ukończone wykonanie przechowuje dokładny model, każdy wynik i opóźnienie pozycji — zaszyfrowane — oraz eksportuje się jako JSON do porównań obok siebie lub śledzenia regresji przy zmianach modelu, promptu czy dostawcy.