AI summary1 แหล่ง· เมื่อวาน · 05:23

Reasoning LLM ยาวขึ้นมีต้นทุนแฝง: งานวิจัยล่าสุดชี้ token inflation, bias และ overthinking

งานวิจัยหลายชิ้นที่ตีพิมพ์บน arXiv ล่าสุดชี้ว่าการใช้ chain-of-thought reasoning ใน LLM มีต้นทุนแฝงหลายด้านที่ dev ควรรู้ quantization (INT4/INT3) ทำให้ token เพิ่มขึ้นโดยไม่เพิ่ม accuracy เรียกว่า token inflation, การบังคับให้ CoT สั้นลงด้วย length penalty อาจซ่อนสาเหตุที่แท้จริงของคำตอบ (ทำให้ monitorability ลดลง), และ CoT ที่ยาวขึ้นกลับเพิ่ม position bias ในการตอบคำถามแบบ multiple-choice นอกจากนี้ยังพบว่า reasoning ต่อหลังจากได้คำตอบถูกแล้วอาจทำให้เบี่ยงเบนจากคำตอบเดิม (overthinking) มีข้อเสนอแนวทางแก้ เช่น การใช้ latent tokens แทน discrete (MUX), การตัด segment ซ้ำซ้อน (SLAT), และ QLPO ที่ควบคุมความยาวโดยไม่แตะ reward function

01
แหล่งข่าว
03
ประเด็น
เมื่อวาน · 05:23
อัปเดต
  • Quantization (INT4/INT3) ทำให้ reasoning token เพิ่มขึ้นโดยไม่เพิ่ม accuracy
  • Length penalty ซ่อนอิทธิพลของ misleading hints ใน CoT
  • CoT ยาวขึ้นสัมพันธ์กับ position bias ที่เพิ่มขึ้นใน reasoning models
ทำอะไรต่อได้

สิ่งที่น่าลองทำต่อหลังอ่านจบ เลือกข้อที่ตรงกับงานของคุณได้เลย

  1. 01ลองเทียบ token count และ accuracy ของโมเดลคุณก่อน/หลัง quantization (INT4) ถ้า token เพิ่มโดย accuracy ไม่เพิ่ม แสดงว่ามี token inflation
  2. 02เช็ค position bias ของโมเดลที่ใช้ CoT โดยสลับลำดับตัวเลือกใน MCQA ถ้าต่างกันมาก ควรรีบัลแลนซ์ training data หรือปรับ prompt
  3. 03ถ้าควบคุมต้นทุนด้วย length penalty ให้ทำ adversarial test ด้วย misleading hints และดูว่า CoT ยังแสดง hint หรือไม่ ถ้าไม่แสดง แสดงว่า penalty มากไป
แหล่งต้นทาง · 8

ลิงก์ต้นทางอยู่ครบ เพื่อให้เปิดอ่านเต็มและเทียบข้อมูลเองได้

แชร์
ข่าวที่เกี่ยวข้อง