Evals หรือ Evaluations คือชุดคำถามหรือโจทย์ที่เราเตรียมไว้เพื่อทดสอบโมเดล AI ว่าตอบได้ถูกต้องแม่นยำแค่ไหน คล้ายกับข้อสอบที่ใช้วัดความรู้ของนักเรียน แต่สำหรับ AI แล้วเราจะวัดหลายมิติ เช่น ความแม่นยำในการตอบคำถาม ความปลอดภัย การใช้เหตุผล หรือความสามารถเฉพาะด้าน โดยแต่ละ eval จะมีชุดคำถามพร้อมคำตอบที่ถูกต้องไว้เปรียบเทียบ
ตัวอย่างเช่น บริษัทที่พัฒนา AI อาจมี eval ชุดหนึ่งที่มีโจทย์คณิตศาสตร์ 1,000 ข้อ เพื่อดูว่าโมเดลใหม่แก้โจทย์ได้ดีขึ้นกว่าเวอร์ชันเก่าหรือไม่ หรือมี eval ที่ทดสอบว่า AI ปฏิเสธคำขอที่ไม่เหมาะสมได้หรือเปล่า การรัน evals เป็นประจำช่วยให้ทีมพัฒนามั่นใจว่า AI ไม่แย่ลงเมื่ออัปเดตใหม่ และยังเป็นมาตรฐานที่ใช้เปรียบเทียบโมเดลต่างๆ ในอุตสาหกรรมด้วย