ข้ามไปยังเนื้อหาหลัก

การประเมินผล

แพลตฟอร์มการประเมินเปลี่ยนการใช้งานประจำวันให้เป็นสัญญาณคุณภาพโมเดลที่เปรียบเทียบกันได้ ได้แก่ ข้อเสนอแนะอย่างรวดเร็วต่อคำตอบแต่ละรายการ การแข่งขันแบบตัวต่อตัวที่ปกปิดชื่อโมเดลพร้อมตารางอันดับ Elo และชุดการประเมินที่นำกลับมาใช้ซ้ำได้ซึ่งรันเป็นงานถาวรและทำซ้ำได้ ทุกอย่างทำงานภายใต้ตัวตนและข้อมูลรับรองผู้ให้บริการของคุณ ส่วนข้อมูลละเอียดอ่อน ได้แก่ snapshot ความคิดเห็น พรอมต์ในชุด และผลลัพธ์การรัน จะถูกเข้ารหัสขณะจัดเก็บ

ข้อเสนอแนะต่อข้อความ

การให้คะแนนคำตอบของผู้ช่วยบันทึกข้อมูลมากกว่าแค่ปุ่มชอบหรือไม่ชอบ แผงขนาดเล็กมีแท็กหัวข้อ (ความถูกต้อง รูปแบบ ไม่สมบูรณ์ เป็นอันตราย การจัดรูปแบบ) และความคิดเห็นเสริม Libre จะเก็บ snapshot ของการโต้ตอบที่ได้รับคะแนน ทั้งพรอมต์ของคุณและคำตอบ เพื่อให้จุดข้อมูลยังคงอยู่แม้ภายหลังจะแก้ไขหรือลบแชต ผู้ใช้หนึ่งคนมีแถวข้อเสนอแนะได้หนึ่งแถวต่อข้อความ การให้คะแนนใหม่จะแทนที่รายการเดิม และการล้างปุ่มชอบจะลบรายการ ชุดข้อมูลของคุณอยู่ที่ Evaluations → Feedback; ผู้ดูแลระบบอ่านชุดข้อมูลทั่วทั้งระบบเพื่อคัดสรรได้ เซสชันส่วนตัวจะไม่สร้างแถวข้อเสนอแนะ

สนามประลองและตารางอันดับ

การแข่งขันในสนามประลองจะส่งพรอมต์หนึ่งรายการไปยังโมเดลสองตัวที่คุณเลือก และแสดงคำตอบทั้งสองในลำดับแบบสุ่ม ตัวตนของโมเดลจะถูกซ่อนจนกว่าจะลงคะแนนว่า ตัวแรก ตัวที่สอง เสมอ หรือแย่ทั้งคู่ ผู้ใช้แต่ละคนลงคะแนนได้หนึ่งครั้งต่อการแข่งขัน ตารางอันดับจะเล่นคะแนนทั้งหมดซ้ำตามลำดับที่เพิ่มเข้าไปผ่านการจัดอันดับ Elo แบบกำหนดผลแน่นอน (K=32, ฐาน 1000) จึงคำนวณใหม่แล้วได้อันดับเดิมเสมอ ตัวเลือก “แย่ทั้งคู่” จะนับการเข้าร่วมโดยไม่เปลี่ยนคะแนน

ชุดการประเมินและการรัน

ชุดการประเมินคือรายการพรอมต์ที่ตั้งชื่อไว้และมีได้สูงสุด 50 รายการ การรันชุดกับโมเดลจะทำงานเป็นงานถาวร โดยรันพรอมต์ทีละรายการภายใต้ข้อมูลรับรองของคุณ แสดงความคืบหน้าระหว่างรัน บันทึกข้อผิดพลาดแยกตามรายการแทนการยุติทั้งรอบ และเมื่อยกเลิกจะทำเครื่องหมายว่ารอบถูกยกเลิก รอบที่เสร็จสมบูรณ์จะเก็บโมเดลที่ใช้จริง ผลลัพธ์ทุกชิ้น และเวลาแฝงรายรายการไว้แบบเข้ารหัส พร้อมส่งออกเป็น JSON เพื่อเปรียบเทียบเคียงข้างกันหรือติดตามการถดถอยเมื่อเปลี่ยนโมเดล พรอมต์ หรือผู้ให้บริการ