Aller au contenu principal

Évaluations

La plateforme d’évaluation transforme l’usage quotidien en signaux comparables sur la qualité des modèles : avis rapide sur les réponses individuelles, confrontations en aveugle dans une arène avec classement Elo et ensembles d’évaluation réutilisables dont les exécutions sont des tâches durables reproductibles. Tout s’exécute sous votre propre identité et avec vos identifiants de fournisseurs, et les éléments sensibles — instantanés, commentaires, requêtes des ensembles et résultats des exécutions — sont chiffrés au repos.

Avis sur les messages

Évaluer la réponse d’un assistant enregistre plus qu’un pouce : un panneau compact propose des étiquettes thématiques (exactitude, style, réponse incomplète, contenu dangereux, mise en forme) et un commentaire facultatif. Libre crée aussi un instantané de l’échange évalué — votre requête et la réponse — afin que le point de données survive aux modifications et suppressions ultérieures du chat. Il existe une ligne d’avis par utilisateur et par message ; une nouvelle évaluation la remplace, et effacer le pouce la supprime. Votre jeu de données se trouve sous Évaluations → Avis ; les administrateurs peuvent lire le jeu de données de l’ensemble de l’instance pour le sélectionner et l’organiser. Les sessions privées ne produisent jamais de lignes d’avis.

Arène et classement

Une confrontation dans l’arène envoie une requête aux deux modèles de votre choix et affiche leurs réponses dans un ordre aléatoire. L’identité des modèles reste masquée jusqu’au vote — premier, second, égalité ou tous deux mauvais — et chaque utilisateur vote une fois par confrontation. Le classement rejoue chaque vote dans l’ordre d’insertion selon une notation Elo déterministe (K=32, base 1000) : son recalcul produit donc toujours le même classement ; « tous deux mauvais » compte comme une participation sans modifier les notes.

Ensembles et exécutions d’évaluation

Un ensemble d’évaluation est une liste nommée d’au plus 50 requêtes. L’exécution d’un ensemble sur un modèle prend la forme d’une tâche durable : chaque requête est exécutée l’une après l’autre avec vos identifiants, la progression reste visible pendant l’exécution, les échecs sont consignés par élément plutôt que d’interrompre toute l’exécution, et une annulation marque l’exécution comme annulée. Une exécution terminée conserve le modèle exact, chaque résultat et la latence par élément, le tout chiffré, et s’exporte au format JSON pour une comparaison côte à côte ou le suivi des régressions lors des changements de modèle, de requête ou de fournisseur.