อินเฟอเรนซ์คือขั้นตอนที่เราเอาโมเดล AI ที่เทรนเสร็จแล้วมาใช้งานจริงๆ เหมือนตอนเราเรียนจบแล้วเอาความรู้ไปใช้ทำงาน เช่น โมเดลที่เทรนจนจำแมวได้แล้ว พอเราป้อนรูปแมวใหม่เข้าไป มันก็จะบอกว่านี่คือแมว นั่นคืออินเฟอเรนซ์ ซึ่งต่างจากการเทรนที่ต้องใช้เวลาและทรัพยากรเยอะมาก อินเฟอเรนซ์ทำได้เร็วกว่าและใช้พลังน้อยกว่าเยอะ
ในชีวิตจริงเราเจออินเฟอเรนซ์ตลอดเวลา เวลาเราถามคำถาม ChatGPT หรือใช้ฟีเจอร์ Face Unlock บนมือถือ หรือแม้แต่ตอนที่ Netflix แนะนำหนังให้เรา ล้วนเป็นอินเฟอเรนซ์ทั้งสิ้น สำหรับคนทำงาน การเข้าใจเรื่องนี้สำคัญเพราะต้นทุนอินเฟอเรนซ์มักเป็นค่าใช้จ่ายหลักในการรัน AI โดยเฉพาะถ้ามีผู้ใช้เยอะ บางบริษัทเลยต้องหาวิธีลดต้นทุนตรงนี้ เช่น ใช้โมเดลเล็กลงหรือเลือก Cloud Provider ที่ถูกกว่า