본문으로 건너뛰기

평가

평가 플랫폼은 일상적인 사용을 비교 가능한 모델 품질 신호로 바꿉니다. 개별 응답에 빠르게 피드백하고, Elo 순위표가 있는 블라인드 일대일 아레나 대결을 진행하며, 재현 가능한 영속 작업으로 실행되는 평가 세트를 재사용할 수 있습니다. 모든 작업은 사용자의 신원과 제공자 자격 증명으로 실행되고, 스냅샷, 의견, 세트 프롬프트 및 실행 출력처럼 민감한 부분은 저장 시 암호화됩니다.

메시지 피드백

어시스턴트 응답을 평가하면 단순한 엄지 표시 이상의 정보가 기록됩니다. 간결한 패널에서 주제 태그(정확성, 스타일, 불완전함, 유해성, 서식)와 선택적 의견을 제공하고, Libre는 평가된 대화—사용자의 프롬프트와 응답—를 스냅샷으로 저장합니다. 따라서 나중에 채팅을 편집하거나 삭제해도 데이터 지점이 유지됩니다. 사용자 및 메시지마다 피드백 행 하나가 존재하며, 다시 평가하면 교체되고 엄지 표시를 지우면 삭제됩니다. 데이터 세트는 평가 → 피드백에 있으며 관리자는 선별을 위해 인스턴스 전체 데이터 세트를 읽을 수 있습니다. 비공개 세션에서는 피드백 행이 생성되지 않습니다.

아레나 및 순위표

아레나 대결은 하나의 프롬프트를 사용자가 선택한 두 모델에 보내고 두 응답을 무작위 순서로 표시합니다. 투표가 제출될 때까지 모델 ID는 숨겨집니다. 첫 번째, 두 번째, 무승부 또는 둘 다 나쁨 중 하나에 투표하며, 각 사용자는 대결당 한 번만 투표할 수 있습니다. 순위표는 모든 투표를 삽입 순서대로 결정론적 Elo 평점(K=32, 기준 1000)에 다시 적용하므로 재계산해도 언제나 같은 순위가 나옵니다. "둘 다 나쁨"은 참여 횟수에는 포함되지만 평점은 바꾸지 않습니다.

평가 세트 및 실행

평가 세트는 최대 50개 프롬프트로 구성된 이름 있는 목록입니다. 모델에 대해 세트를 실행하면 영속 작업으로 처리됩니다. 각 프롬프트는 사용자의 자격 증명으로 한 번에 하나씩 실행되고 진행 상황이 표시됩니다. 항목 실패는 실행 전체를 중단하지 않고 항목별로 기록되며, 취소하면 실행 상태가 취소됨으로 표시됩니다. 완료된 실행에는 정확한 모델, 모든 출력 및 항목별 지연 시간이 암호화되어 저장되며, 모델·프롬프트·제공자 변경 전후를 나란히 비교하거나 회귀를 추적할 수 있도록 JSON으로 내보낼 수 있습니다.