AI summary1 แหล่ง· เมื่อวาน · 05:19
วิจัยใหม่เผย LoRA ล้มเหลวสอนขั้นตอนหลายขั้น GRPO เสี่ยง mode collapse
งานวิจัยจาก arXiv หลายชิ้นชี้ให้เห็นข้อจำกัดของเทคนิค fine-tuning ยอดนิยมอย่าง LoRA และ GRPO ในการสอน procedural knowledge และการหลีกเลี่ยง mode collapse โดยเฉพาะ LoRA ที่ rank ปกติ (16-128) ไม่สามารถเรียนรู้ขั้นตอนที่มี conditional branching ได้เลย ขณะที่ GRPO มีปัญหา mode collapse คือกระจายความน่าจะเป็นไปที่คำตอบเดียวแล้วหยุดสำรวจ งานวิจัยเหล่านี้เสนอทางเลือกใหม่ เช่น การใช้ process reward, การทำ distribution matching, และการปรับปรุง credit assignment แบบ segment-level ซึ่งน่าสนใจสำหรับ dev ที่กำลังปรับ LLM ให้ทำงาน multi-step reasoning หรือ agentic tasks
01
แหล่งข่าว
03
ประเด็น
เมื่อวาน · 05:19
อัปเดต
- LoRA ที่ rank 16-128 ล้มเหลวในการเรียนรู้ procedural knowledge แบบ multi-step อย่างสม่ำเสมอ
- GRPO มี mode collapse เพราะ reverse KL minimization เลือก reinforce เส้นทางแรกที่เจอ
- งานวิจัยเสนอทางเลือกเช่น process reward, distribution matching, segment-level policy optimization
ทำอะไรต่อได้
สิ่งที่น่าลองทำต่อหลังอ่านจบ เลือกข้อที่ตรงกับงานของคุณได้เลย
- 01ทดสอบ LoRA กับ task ที่มี procedural branching ก่อนใช้จริง ถ้า task ต้องเดินหลายขั้นตอนแบบมีเงื่อนไข อาจต้องใช้ full fine-tuning แทน
- 02ลองเปลี่ยน reward function จาก terminal reward เป็น process reward หรือ leave-one-turn attribution (LAPO) เพื่อให้ credit assignment ละเอียดขึ้น
- 03เทียบ GRPO กับ DMPO หรือ SGPO ในงานที่ต้องการ solution diversity ถ้าเจอ mode collapse ให้ลองใช้ distribution matching แทน
แหล่งต้นทาง · 9
ลิงก์ต้นทางอยู่ครบ เพื่อให้เปิดอ่านเต็มและเทียบข้อมูลเองได้
ENENENENENENENENEN
arXiv — cs.AIเมื่อวาน · 04:00
Procedural Knowledge Is Not Low-Rank: Why LoRA Fails to Internalize Multi-Step Procedures
arXiv — cs.AIเมื่อวาน · 04:00
Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control
arXiv — cs.AI21 ก.ค.
PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization
arXiv — cs.AI16 ก.ค.
LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
arXiv — cs.AI24 มิ.ย.
Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning
arXiv — cs.AI11 มิ.ย.
HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation
arXiv — cs.AI20 พ.ค.
What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
arXiv — cs.AI20 พ.ค.
Beyond Mode Collapse: Distribution Matching for Diverse Reasoning
arXiv — cs.AI6 พ.ค.
Segment-Aligned Policy Optimization for Multi-Modal Reasoning
แชร์
ข่าวที่เกี่ยวข้อง
ศาลอนุมัติ Anthropic จ่าย $1.5 พันล้านชดเชยละเมิดลิขสิทธิ์หนังสือ 5 แสนเล่ม
3 แหล่ง · 40 นาทีที่แล้ว
OpenAI models หลุด sandbox เจาะ Hugging Face ขโมยข้อมูล benchmark
3 แหล่ง · 40 นาทีที่แล้ว
SpaceX ซื้อ Cursor มูลค่า 6 หมื่นล้านดอลลาร์ หลัง IPO ไม่กี่วัน
3 แหล่ง · 40 นาทีที่แล้ว
AI เร่งช่องว่างระหว่าง Build กับ GTM 3 ประเด็นที่ PM และ Founder ต้องปรับ
1 แหล่ง · วันนี้ · 23:08
งานวิจัยล่าสุดชี้ AI agents กำลังก้าวสู่การปรับปรุงตัวเองแบบอัตโนมัติ
2 แหล่ง · วันนี้ · 23:07