บางครั้งสิ่งที่น่าสนใจกว่าการเปิดตัว AI model ใหม่ ไม่ใช่คำว่า “เก่งขึ้น” แต่คือคำถามว่า ก่อนหน้านี้มันแย่ลงเพราะอะไร แล้วการออกรุ่นใหม่รอบนี้คือความก้าวหน้าจริง หรือเป็นการเอาของเดิมที่ถูกปรับให้ด้อยลงกลับมาทำให้ดีอีกครั้ง
ประเด็นนี้ถูกหยิบมาวิเคราะห์อย่างถึงแก่นในคลิปของ Nate Herk | AI Automation ที่แกะเคส Claude Opus 4.7 แบบไม่วิ่งตามกระแส เขาย้อนรอยตั้งแต่ปัญหาของ Opus 4.6 ไปจนถึง benchmark, ฟีเจอร์ใหม่ และการทดสอบใช้งานจริงแบบ rapid test ซึ่งผลลัพธ์ที่ออกมาน่าสนใจมากสำหรับคนที่ใช้ AI ขับเคลื่อนธุรกิจจริง โดยเฉพาะเจ้าของกิจการและทีมงานที่ไม่ได้เขียนโค้ดเองตลอดเวลา แต่พึ่งพา AI ในการคิด วิเคราะห์ สรุป และช่วยตัดสินใจ
ประเด็นสำคัญไม่ได้อยู่แค่ว่า Opus 4.7 ดีไหม แต่อยู่ที่ว่าเราควรเชื่อ benchmark แค่ไหน และหากนำ AI ไปใช้กับธุรกิจจริง เราควรวัดผลจากอะไรบ้าง เพื่อไม่ให้จ่ายแพงขึ้นแต่ได้งานที่มั่นใจน้อยลง
ปัญหาของ Opus 4.6 ไม่ได้เป็นแค่ดราม่า แต่กระทบงานจริง
จุดตั้งต้นของเรื่องนี้คือเสียงบ่นจากผู้ใช้จำนวนมากที่รู้สึกว่า Opus 4.6 ฉลาดน้อยลงในช่วงไม่กี่สัปดาห์ที่ผ่านมา หากเป็นแค่ความรู้สึกส่วนตัวก็คงยังถกเถียงกันได้ แต่ประเด็นเริ่มร้อนแรงเมื่อมีการอ้างอิงงานวิเคราะห์จาก Senior Director ของ AMD ที่ตรวจสอบข้อมูลเกือบ 7,000 coding sessions ใน Claude Code และพบสัญญาณเตือนที่ชัดเจนมาก
ความลึกในการคิด (reasoning) ลดลงประมาณ 73%
Model เริ่มแก้ไฟล์โดยไม่อ่านบริบทก่อนบ่อยขึ้น
ผู้ใช้ต้องคอยเบรกหรือแทรกแซงมากขึ้นถึง 12 เท่า
เกิด hallucination บ่อยขึ้น เช่น commit hash ปลอม, package ปลอม, API version มั่ว
มีอาการเลิกทำงานกลางคัน (abandon task)
ถ้ามองจากมุมธุรกิจ เรื่องนี้สำคัญกว่าที่คิด เพราะคนส่วนใหญ่ไม่ได้ใช้ AI แค่ถามตอบเล่นๆ แต่ใช้กับงานที่กระทบต่อรายได้ เช่น สรุปรายงาน วิเคราะห์ตัวเลข เขียน proposal วางแผนการตลาด หรือเตรียมเอกสารลูกค้า หาก model “ข้ามขั้นคิด” และรีบตอบเร็วเกินไป สิ่งที่เสียไม่ใช่แค่คุณภาพงาน แต่คือเวลาในการตรวจแก้และความเสี่ยงในการตัดสินใจผิด
อีกมุมที่ Nate ชี้ไว้และน่าคิดมาก คือคนที่จ่ายแพ็กเกจระดับ 200 ดอลลาร์ต่อเดือน เริ่มรู้สึกว่า token หมดเร็วผิดปกติแต่คุณภาพกลับไม่คุ้มราคา นี่คือปัญหาคลาสสิกของ AI ในองค์กร คือต้นทุนพุ่งแบบเงียบๆ เพราะทีมงานไม่ได้เห็นทันทีว่าค่าเสียหายเกิดจาก model ตอบผิด หรือเกิดจากการต้องสั่งซ้ำหลายรอบ
Anthropic เปลี่ยน model จริง หรือแค่เปลี่ยนวิธีให้มันคิด?
จุดที่ทำให้เรื่องนี้ไม่ธรรมดา คือปัญหาหลายอย่างของ Opus 4.6 ดูเหมือนจะไม่ได้เกิดจากตัว model เสื่อมสภาพลงตรงๆ แต่เกิดจากการปรับ “พฤติกรรมการคิด” ของมันแทน
ตามข้อมูลที่ถูกอธิบายไว้ Anthropic เคยเปลี่ยนระบบ adaptive thinking ให้ model ตัดสินใจเองว่าแต่ละคำถามควรใช้ reasoning มากน้อยแค่ไหน หากมันมองว่างานง่าย มันอาจให้ reasoning token เป็นศูนย์ หรือพูดง่ายๆ คือไม่คิดเลยแล้วตอบทันที
ฟังดูดีในเชิงต้นทุน แต่ปัญหาคือ AI มักประเมินความยากของโจทย์ผิด โดยเฉพาะโจทย์ธุรกิจที่ดูเหมือนสั้นแต่จริงๆ ต้องใช้ความเข้าใจหลายชั้น เช่น
“ช่วยสรุปแผนการเงิน 12 เดือนให้หน่อย”
“ช่วยเทียบแพ็กเกจราคาแล้วแนะนำว่าควรปรับ tier ไหน”
“ช่วยเขียนอีเมลตอบลูกค้าที่กำลังจะยกเลิกบริการ”
คำสั่งพวกนี้ไม่ได้ซับซ้อนในรูปประโยค แต่ซับซ้อนในเชิงผลลัพธ์ หาก model คิดน้อยเกินไป มันจะตอบแบบผิวเผิน ดูเหมือนโอเคแต่ใช้งานจริงไม่ได้
อีกเรื่องคือค่า effort default ถูกลดลงเหลือแค่ระดับ medium โดยที่หลายคนไม่รู้ตัว นี่แหละคือจุดที่ทำให้หลายคนรู้สึกว่า “AI โง่ลง” ทั้งที่ตัว model อาจไม่ได้เปลี่ยน แต่ระบบถูกปรับให้คิดน้อยลง
ถ้าแปลเป็นภาษาคนทำธุรกิจ ก็เหมือนเราจ้างผู้ช่วยคนเดิม แต่สั่งให้เขารีบทำ รีบตอบ และห้ามใช้เวลาตรวจงานมาก ผลลัพธ์ย่อมดรอปแม้คนเดิมจะยังเก่งเท่าเดิมก็ตาม
ทำไม Opus 4.7 ถึงดูเหมือนแก้ทุกข้อร้องเรียนได้พอดี
เมื่อ Claude Opus 4.7 เปิดตัว สิ่งที่สะดุดตาคือคำอธิบายแทบทุกข้อเหมือนตอบรับเสียงบ่นของชุมชนแบบตรงจุดมาก
บ่นว่า model คิดตื้น ก็มี X High effort เพิ่มเข้ามา
บ่นว่าทำงานไม่จบ ก็เคลมว่ามอบงานยากให้มันได้มั่นใจขึ้น
บ่นว่าไม่ตาม instruction ก็ประกาศว่าทำตามคำสั่งได้ตรงขึ้น
บ่นว่า hallucination เยอะ ก็ระบุว่าตรวจตราความผิดพลาดของตัวเองได้ดีขึ้น
บ่นว่า vision อ่อน ก็ประกาศว่าดีขึ้นมาก
บ่นเรื่อง safety และพฤติกรรมแปลกๆ ก็มีการอธิบาย benchmark ด้าน alignment เพิ่ม
ตรงนี้เองที่ทำให้หลายคนเริ่มตั้งคำถามว่า นี่คือการพัฒนา model ใหม่จริง หรือเป็นการอุดรูรั่วที่เกิดจากการตั้งค่ารุ่นก่อนหน้าไม่ดีพอ
มุมมองของ Nate ค่อนข้างแฟร์ เขาไม่ได้บอกว่านี่เป็นเรื่องแย่เสมอไป เพราะการ iterate product ก็ควรทำแบบนี้อยู่แล้ว แต่ปัญหาคือหากรุ่นก่อนถูกปรับให้ด้อยลงแบบเงียบๆ แล้วค่อยเปิดรุ่นใหม่พร้อมคำว่า “ดีขึ้นมาก” มันก็ทำให้ความเชื่อมั่นของผู้ใช้สั่นคลอน
สำหรับธุรกิจ นี่เป็นบทเรียนสำคัญมากว่าอย่ายึดติดกับชื่อรุ่นหรือคำโฆษณา ให้ยึดกับผลลัพธ์งานจริงใน workflow ของเราแทน เช่น
สรุปประชุมแล้วใช้ต่อได้ไหม
ช่วยวิเคราะห์ตัวเลขแล้วเหตุผลแน่นพอไหม
อ่านเอกสารยาวๆ แล้วจับประเด็นสำคัญครบไหม
ตอบตาม format ที่ทีมต้องการได้สม่ำเสมอไหม
Benchmark ดูดีขึ้น แต่ธุรกิจไม่ควรตัดสินจาก benchmark อย่างเดียว
ในภาพรวม 4.7 ทำคะแนนดีขึ้นหลายด้าน ทั้ง software engineering, knowledge work, document reasoning, long context, biomolecular reasoning, vision และงานที่ต้องคงความต่อเนื่องระยะยาว
สำหรับคนที่ไม่ได้เป็น developer ประเด็นที่ควรสนใจเป็นพิเศษมี 3 เรื่อง
งานเอกสารและการอ่านข้อมูลยาวๆ
หาก model จัดการเอกสารยาวและ context ขนาดใหญ่ได้ดีขึ้นจริง งานประเภทสัญญา, proposal, policy, รายงานยอดขาย หรือสรุปข้อมูลจากหลายไฟล์จะ