evaluation · พื้นฐาน

Benchmark

เบนช์มาร์ก

ชุดข้อสอบมาตรฐานที่ใช้วัดความสามารถของโมเดล AI ว่าทำงานได้ดีแค่ไหนเทียบกับโมเดลอื่น

evaluation
หมวด
พื้นฐาน
ระดับ
0
บทความ

เบนช์มาร์กก็เหมือนข้อสอบกลางที่ทุกโมเดล AI ต้องมาทำชุดเดียวกัน เพื่อให้เราเปรียบเทียบกันได้ว่าใครเก่งกว่ากัน มันจะมีชุดคำถามหรือโจทย์ที่ออกแบบมาเฉพาะเจาะจง เช่น ทดสอบความเข้าใจภาษา ความสามารถในการแก้โจทย์คณิตศาสตร์ หรือการตอบคำถามเชิงเหตุผล แล้วให้คะแนนออกมาเป็นตัวเลขที่วัดได้ชัดเจน

ตัวอย่างเบนช์มาร์กที่เจอบ่อยคือ MMLU ที่ทดสอบความรู้หลากหลายสาขา หรือ HumanEval ที่ให้ AI เขียนโค้ด เวลาบริษัทอย่าง OpenAI หรือ Google ประกาศโมเดลใหม่ เขามักจะอ้างผลคะแนนเบนช์มาร์กเหล่านี้เพื่อบอกว่าโมเดลของตัวเองดีขึ้นกว่าเดิมหรือแข่งกับคู่แข่งได้ แต่ต้องระวังว่าคะแนนสูงในเบนช์มาร์กไม่ได้แปลว่าใช้งานจริงจะดีเสมอไป เพราะบางทีโมเดลอาจจำคำตอบในชุดทดสอบมาแล้ว