Přeskočit na hlavní obsah

Vyhodnocování

Vyhodnocovací platforma mění každodenní používání na porovnatelné signály kvality modelů: rychlou zpětnou vazbu k jednotlivým odpovědím, slepé souboje s žebříčkem Elo a znovu použitelné sady hodnocení, jejichž běhy jsou reprodukovatelné trvalé úlohy. Vše běží pod vaší identitou a přihlašovacími údaji poskytovatele. Citlivé části — snapshoty, komentáře, prompty sad a výstupy běhů — jsou v úložišti šifrované.

Zpětná vazba ke zprávám

Hodnocení odpovědi asistenta ukládá více než jen palec. Kompaktní panel nabízí tematické štítky (přesnost, styl, neúplnost, škodlivost, formátování) a volitelný komentář. Libre pořídí snapshot hodnocené výměny — vašeho promptu a odpovědi — takže datový bod přežije pozdější úpravy i smazání chatu. Pro jednoho uživatele a zprávu existuje jediný řádek; nové hodnocení jej nahradí a zrušení palce jej smaže. Vaše data jsou v Evaluations → Feedback; administrátoři mohou pro účely kurátorství číst data celé instance. Soukromé relace záznamy zpětné vazby nevytvářejí.

Aréna a žebříček

Zápas v aréně odešle jeden prompt dvěma vybraným modelům a odpovědi ukáže v náhodném pořadí. Identity modelů zůstanou skryté až do hlasování — první, druhý, remíza nebo oba špatné — a každý uživatel hlasuje jednou za zápas. Žebříček přehrává hlasy v pořadí vložení deterministickým výpočtem Elo (K=32, základ 1000), takže opětovný výpočet vždy vytvoří stejné pořadí. „Oba špatné“ započítá účast bez změny ratingu.

Sady vyhodnocení a běhy

Sada vyhodnocení je pojmenovaný seznam nejvýše 50 promptů. Běh proti modelu se provádí jako trvalá úloha: prompty běží po jednom pod vašimi přihlašovacími údaji, průběh je viditelný, chyba se zaznamená u konkrétní položky místo ukončení celého běhu a zrušení označí běh jako zrušený. Dokončený běh ukládá přesný model, všechny výstupy a latenci jednotlivých položek šifrovaně a lze jej exportovat do JSON pro srovnání nebo sledování regresí mezi změnami modelu, promptu či poskytovatele.