Reasoning LLM ยาวขึ้นมีต้นทุนแฝง: งานวิจัยล่าสุดชี้ token inflation, bias และ overthinking
งานวิจัยหลายชิ้นที่ตีพิมพ์บน arXiv ล่าสุดชี้ว่าการใช้ chain-of-thought reasoning ใน LLM มีต้นทุนแฝงหลายด้านที่ dev ควรรู้ quantization (INT4/INT3) ทำให้ token เพิ่มขึ้นโดยไม่เพิ่ม accuracy เรียกว่า token inflation, การบังคับให้ CoT สั้นลงด้วย length penalty อาจซ่อนสาเหตุที่แท้จริงของคำตอบ (ทำให้ monitorability ลดลง), และ CoT ที่ยาวขึ้นกลับเพิ่ม position bias ในการตอบคำถามแบบ multiple-choice นอกจากนี้ยังพบว่า reasoning ต่อหลังจากได้คำตอบถูกแล้วอาจทำให้เบี่ยงเบนจากคำตอบเดิม (overthinking) มีข้อเสนอแนวทางแก้ เช่น การใช้ latent tokens แทน discrete (MUX), การตัด segment ซ้ำซ้อน (SLAT), และ QLPO ที่ควบคุมความยาวโดยไม่แตะ reward function
- Quantization (INT4/INT3) ทำให้ reasoning token เพิ่มขึ้นโดยไม่เพิ่ม accuracy
- Length penalty ซ่อนอิทธิพลของ misleading hints ใน CoT
- CoT ยาวขึ้นสัมพันธ์กับ position bias ที่เพิ่มขึ้นใน reasoning models
สิ่งที่น่าลองทำต่อหลังอ่านจบ เลือกข้อที่ตรงกับงานของคุณได้เลย
- 01ลองเทียบ token count และ accuracy ของโมเดลคุณก่อน/หลัง quantization (INT4) ถ้า token เพิ่มโดย accuracy ไม่เพิ่ม แสดงว่ามี token inflation
- 02เช็ค position bias ของโมเดลที่ใช้ CoT โดยสลับลำดับตัวเลือกใน MCQA ถ้าต่างกันมาก ควรรีบัลแลนซ์ training data หรือปรับ prompt
- 03ถ้าควบคุมต้นทุนด้วย length penalty ให้ทำ adversarial test ด้วย misleading hints และดูว่า CoT ยังแสดง hint หรือไม่ ถ้าไม่แสดง แสดงว่า penalty มากไป
ลิงก์ต้นทางอยู่ครบ เพื่อให้เปิดอ่านเต็มและเทียบข้อมูลเองได้