Avaliações
A plataforma de avaliações transforma o uso cotidiano em sinais comparáveis de qualidade dos modelos: feedback rápido sobre respostas individuais, confrontos cegos na arena com um ranking Elo e conjuntos de avaliação reutilizáveis cujas execuções são tarefas duráveis e reproduzíveis. Tudo é executado com sua própria identidade e as credenciais do provedor, e as partes confidenciais — snapshots, comentários, prompts dos conjuntos e resultados das execuções — são criptografadas em repouso.
Feedback sobre mensagens
Avaliar uma resposta do assistente registra mais do que um polegar: um painel compacto oferece etiquetas de assunto (precisão, estilo, incompleto, nocivo, formatação) e um comentário opcional, e o Libre cria um snapshot da interação avaliada — seu prompt e a resposta — para que o ponto de dados sobreviva a edições e exclusões posteriores da conversa. Existe uma linha de feedback por usuário e mensagem; uma nova avaliação a substitui, e limpar o polegar a exclui. Seu conjunto de dados fica em Avaliações → Feedback; os administradores podem ler o conjunto de dados de toda a instância para curadoria. Sessões privadas nunca geram linhas de feedback.
Arena e ranking
Uma partida na arena envia um prompt a dois modelos escolhidos por você e mostra as duas respostas em ordem aleatória. As identidades dos modelos permanecem ocultas até o registro do voto — primeiro, segundo, empate ou ambos ruins — e cada usuário vota uma vez por partida. O ranking reproduz cada voto na ordem de inserção por meio de uma classificação Elo determinística (K=32, base 1000), de modo que recalculá-lo sempre produz as mesmas posições; "ambos ruins" conta como participação sem alterar as classificações.
Conjuntos e execuções de avaliação
Um conjunto de avaliação é uma lista nomeada de até 50 prompts. Executar um conjunto com um modelo ocorre como uma tarefa durável: cada prompt é executado um de cada vez com suas credenciais, o progresso fica visível durante a execução, as falhas de itens são registradas por item em vez de interromper a execução e o cancelamento marca a execução como cancelada. Uma execução concluída armazena o modelo exato, todos os resultados e a latência de cada item — de forma criptografada — e exporta os dados como JSON para comparação lado a lado ou acompanhamento de regressões entre alterações de modelo, prompt ou provedor.