arXiv เผย 10 งานวิจัยใหม่ ช่วย dev ปรับปรุง LLM agent ด้าน search และ evaluation
arXiv มีงานวิจัย 10 เรื่องจากเดือน มิ.ย.-ก.ค. 2025 ที่เสนอแนวทางใหม่ในการพัฒนา LLM agent โดยเน้นสามด้านหลัก: (1) การประเมินที่บอกสาเหตุของความล้มเหลว ไม่ใช่แค่จุดที่ผิด เช่น CRAFT ที่ใช้ rubric criteria เป็น probe; (2) คลังทักษะขนาดใหญ่และวิธีเลือกทักษะเชิงโครงสร้าง เช่น SkillCenter (216k+ skills) และ SkillDAG ที่ใช้ typed graph; (3) การปรับปรุง deep search และ multi-step reasoning เช่น SearchEyes (knowledge graph simulate search world), TreeSeeker (tree-structured trial-and-error), LongSeeker (context orchestration), DailyReport (benchmark daily search), และ SCALE (self-cognitive exploration) รวมถึง Web2BigTable สำหรับ structured extraction และ PersonaTrail สำหรับ personalization จาก browsing history งานเหล่านี้ให้แนวทางปฏิบัติที่ dev, PM และ founder สามารถเอาไปปรับใช้ในการพัฒนา agent evaluation pipeline, skill library, และ search agent ของตัวเองได้ทันที
- CRAFT ใช้ grading criteria แต่ละข้อวินิจฉัยจุดอ่อนของ model แบบเจาะจง capability
- SkillCenter มี 216,938 skills และ SkillDAG เลือกทักษะผ่าน typed graph แทน embedding similarity
- SearchEyes, TreeSeeker, LongSeeker, DailyReport ปรับปรุง deep search ด้วย simulation, tree search, context orchestration และ benchmark
สิ่งที่น่าลองทำต่อหลังอ่านจบ เลือกข้อที่ตรงกับงานของคุณได้เลย
- 01ลองนำแนวคิด CRAFT ไปปรับใช้กับ evaluation pipeline ของคุณ ใช้ grading criteria แต่ละข้อเป็น probe เพื่อหาจุดอ่อน capability ของ model ก่อน generate post-training data
- 02เทียบคลังทักษะ SkillCenter (216k+ skills 24 domains) กับ skill library ที่ทีมคุณใช้อยู่ ถ้ายังไม่มี structured retrieval ให้ลอง integrate SkillDAG เพื่อเลือกทักษะเชิงโครงสร้าง
- 03ทดสอบ agent ของคุณกับ DailyReport benchmark ซึ่งเน้น daily search task แบบ open-ended ถ้า agent ทำ search multi-step ได้ไม่ดี ให้ลองปรับใช้ TreeSeeker หรือ LongSeeker เพื่อจัดการ context และ trial-and-error
ลิงก์ต้นทางอยู่ครบ เพื่อให้เปิดอ่านเต็มและเทียบข้อมูลเองได้