跳到主要内容

评估

评估平台把日常使用转为可比较的质量信号:单条回复反馈、带 Elo 排行的盲测对决,以及以可复现持久任务运行的可复用评估集。所有操作使用你的身份和提供商凭据;快照、评论、Prompt 和输出静态加密。

消息反馈

评价助手回复可选择准确性、风格、不完整、有害、格式等标签,并添加可选评论。Libre 会快照保存 Prompt 与回复,使数据在后续编辑或删除聊天后仍存在。每个用户和消息只有一行;重新评价会替换,清除会删除。数据位于评估 → 反馈,管理员可查看全实例数据集。私密会话不生成反馈。

竞技场和排行榜

竞技场将一个 Prompt 发送给两个模型并随机展示回复。投票前隐藏身份,可选择第一个、第二个、平局或都不好;每位用户每场只能投一次。排行榜按插入顺序以确定性 Elo(K=32,base 1000)重放;“都不好”计入参与但不改变分数。

评估集和运行

评估集最多包含 50 个 Prompt。针对模型运行时会创建持久任务:使用你的凭据逐项执行、显示进度、按项记录失败而不中止全局,并支持取消。完成后以加密形式保存确切模型、全部输出和每项延迟,并导出 JSON 供并排比较和回归跟踪。