AI summary1 แหล่ง· เมื่อวาน · 05:19

วิจัยใหม่เผย LoRA ล้มเหลวสอนขั้นตอนหลายขั้น GRPO เสี่ยง mode collapse

งานวิจัยจาก arXiv หลายชิ้นชี้ให้เห็นข้อจำกัดของเทคนิค fine-tuning ยอดนิยมอย่าง LoRA และ GRPO ในการสอน procedural knowledge และการหลีกเลี่ยง mode collapse โดยเฉพาะ LoRA ที่ rank ปกติ (16-128) ไม่สามารถเรียนรู้ขั้นตอนที่มี conditional branching ได้เลย ขณะที่ GRPO มีปัญหา mode collapse คือกระจายความน่าจะเป็นไปที่คำตอบเดียวแล้วหยุดสำรวจ งานวิจัยเหล่านี้เสนอทางเลือกใหม่ เช่น การใช้ process reward, การทำ distribution matching, และการปรับปรุง credit assignment แบบ segment-level ซึ่งน่าสนใจสำหรับ dev ที่กำลังปรับ LLM ให้ทำงาน multi-step reasoning หรือ agentic tasks

01
แหล่งข่าว
03
ประเด็น
เมื่อวาน · 05:19
อัปเดต
  • LoRA ที่ rank 16-128 ล้มเหลวในการเรียนรู้ procedural knowledge แบบ multi-step อย่างสม่ำเสมอ
  • GRPO มี mode collapse เพราะ reverse KL minimization เลือก reinforce เส้นทางแรกที่เจอ
  • งานวิจัยเสนอทางเลือกเช่น process reward, distribution matching, segment-level policy optimization
ทำอะไรต่อได้

สิ่งที่น่าลองทำต่อหลังอ่านจบ เลือกข้อที่ตรงกับงานของคุณได้เลย

  1. 01ทดสอบ LoRA กับ task ที่มี procedural branching ก่อนใช้จริง ถ้า task ต้องเดินหลายขั้นตอนแบบมีเงื่อนไข อาจต้องใช้ full fine-tuning แทน
  2. 02ลองเปลี่ยน reward function จาก terminal reward เป็น process reward หรือ leave-one-turn attribution (LAPO) เพื่อให้ credit assignment ละเอียดขึ้น
  3. 03เทียบ GRPO กับ DMPO หรือ SGPO ในงานที่ต้องการ solution diversity ถ้าเจอ mode collapse ให้ลองใช้ distribution matching แทน
แหล่งต้นทาง · 9

ลิงก์ต้นทางอยู่ครบ เพื่อให้เปิดอ่านเต็มและเทียบข้อมูลเองได้

แชร์
ข่าวที่เกี่ยวข้อง