เบนช์มาร์กก็เหมือนข้อสอบกลางที่ทุกโมเดล AI ต้องมาทำชุดเดียวกัน เพื่อให้เราเปรียบเทียบกันได้ว่าใครเก่งกว่ากัน มันจะมีชุดคำถามหรือโจทย์ที่ออกแบบมาเฉพาะเจาะจง เช่น ทดสอบความเข้าใจภาษา ความสามารถในการแก้โจทย์คณิตศาสตร์ หรือการตอบคำถามเชิงเหตุผล แล้วให้คะแนนออกมาเป็นตัวเลขที่วัดได้ชัดเจน
ตัวอย่างเบนช์มาร์กที่เจอบ่อยคือ MMLU ที่ทดสอบความรู้หลากหลายสาขา หรือ HumanEval ที่ให้ AI เขียนโค้ด เวลาบริษัทอย่าง OpenAI หรือ Google ประกาศโมเดลใหม่ เขามักจะอ้างผลคะแนนเบนช์มาร์กเหล่านี้เพื่อบอกว่าโมเดลของตัวเองดีขึ้นกว่าเดิมหรือแข่งกับคู่แข่งได้ แต่ต้องระวังว่าคะแนนสูงในเบนช์มาร์กไม่ได้แปลว่าใช้งานจริงจะดีเสมอไป เพราะบางทีโมเดลอาจจำคำตอบในชุดทดสอบมาแล้ว