التقييمات
تحوّل منصة التقييم الاستخدام اليومي إلى إشارات قابلة للمقارنة عن جودة النماذج: ملاحظات سريعة على الردود الفردية، ومواجهات عمياء في ساحة مع لوحة Elo، ومجموعات تقييم قابلة لإعادة الاستخدام تعمل عملياتها كمهام دائمة قابلة للتكرار. يجري كل شيء تحت هويتك وبيانات اعتماد موفّريك، وتُشفّر الأجزاء الحساسة — اللقطات والتعليقات ومطالبات المجموعات ومخرجات العمليات — أثناء التخزين.
ملاحظات الرسائل
يسجل تقييم رد المساعد أكثر من إشارة إعجاب: تعرض لوحة صغيرة وسوم موضوعات (الدقة والأسلوب وعدم الاكتمال والضرر والتنسيق) وتعليقًا اختياريًا، ويلتقط Libre نسخة من التبادل المقيم — مطالبتك والرد — كي تبقى نقطة البيانات بعد تحرير المحادثة أو حذفها. توجد خانة ملاحظات واحدة لكل مستخدم ورسالة؛ يستبدلها إعادة التقييم ويحذفها مسح الإشارة. توجد بياناتك ضمن التقييمات ← الملاحظات، ويمكن للمسؤولين قراءة بيانات المثيل كاملةً للتنظيم. لا تنتج الجلسات الخاصة أي خانات ملاحظات.
الساحة ولوحة الترتيب
ترسل مواجهة الساحة مطالبة واحدة إلى نموذجين تختارهما وتعرض الردين بترتيب عشوائي. تبقى هويتا النموذجين مخفيتين حتى تسجيل التصويت — الأول أو الثاني أو تعادل أو كلاهما سيئ — ويصوت كل مستخدم مرة لكل مواجهة. تعيد لوحة الترتيب تشغيل كل تصويت بترتيب الإدخال عبر تقييم Elo حتمي (K=32، base 1000)، لذلك يعطي إعادة الحساب الترتيب نفسه دائمًا؛ ويحسب «كلاهما سيئ» مشاركةً من دون تغيير الدرجات.
مجموعات التقييم وعملياته
مجموعة التقييم قائمة مسماة تضم حتى 50 مطالبة. يعمل تشغيل مجموعة على نموذج كمهمة دائمة: تُنفذ المطالبات واحدة تلو الأخرى ببيانات اعتمادك، ويظهر التقدم أثناء التشغيل، وتُسجل إخفاقات العناصر لكل عنصر بدل إيقاف العملية، ويضع الإلغاء علامة الإلغاء على العملية. تخزن العملية المكتملة النموذج الدقيق وكل مخرج وزمن الوصول لكل عنصر — مشفّرة — وتُصدّر بصيغة JSON للمقارنة جنبًا إلى جنب أو تتبع الانحدار عبر تغييرات النموذج أو المطالبة أو الموفّر.