ข่าว AI ที่กำลังขยับตอนนี้
ข่าวจากหลายแหล่งที่รวมเป็นเรื่องเดียวให้แล้ว เหมาะสำหรับเช็กระหว่างวัน ก่อนเลือกอ่านต้นทางต่อ
AI วัดผลด้วย 'intelligence-per-dollar' จาก benchmark สู่คุณค่าจริงและต้นทุน
งานวิจัยและบทวิเคราะห์ล่าสุดจาก arXiv และ Forbes ชี้ว่า benchmark AI แบบเดิมอย่าง NLP reasoning scores ไม่สะท้อนคุณค่าจริงหรือต้นทุนการใช้งานอีกต่อไป หลายทีมเสนอ metric ใหม่แบบ intelligence-per-dollar ที่เน้น performance ต่อหน่วยเงิน, open-world evaluation ที่วัดในงานจริงระยะยาว, และ relative measurement ที่เปรียบเทียบความสามารถของ model กันเองแทนเทียบมนุษย์ แนวโน้มนี้สะท้อนว่า dev/PM ต้องคิดเรื่อง cost-awareness ตั้งแต่เลือก model, วัดผลใน production context จริง และไม่เชื่อ benchmark เปรียบเทียบตรงๆ โดยไม่คิดต้นทุน
Prompting ไม่ใช่ทุกอย่างอีกต่อไป งานวิจัยและฟิลด์ชี้ต้องมี feedback loop แทน
หลายบทความจาก Forbes และ arXiv ชี้ตรงกันว่าแนวคิด 'prompt คือทุกสิ่ง' กำลังล้าสมัย โดยเฉพาะใน enterprise workflows ที่ต้องทำงานหลายรอบ (multi-turn) งานวิจัยจาก arXiv แสดงให้เห็นว่า LLM มัก 'หลุดประเด็น' ในการสนทนายาวเพราะ attention สูญเสียการเข้าถึง goal tokens ขณะที่ฟิลด์จาก Forbes เน้นว่าคุณภาพที่แท้จริงมาจาก evaluation loops, critique chains และ scoring functions ที่ทำงานหลัง prompt ไม่ใช่จาก prompt ตัวเดียวอีกต่อไป การเปลี่ยนจาก single-shot เป็น iterative feedback loop คือสิ่งที่แยกทีมที่เร็วออกจากทีมที่ช้า
arXiv เผย 10 งานวิจัยใหม่ ช่วย dev ปรับปรุง LLM agent ด้าน search และ evaluation
arXiv มีงานวิจัย 10 เรื่องจากเดือน มิ.ย.-ก.ค. 2025 ที่เสนอแนวทางใหม่ในการพัฒนา LLM agent โดยเน้นสามด้านหลัก: (1) การประเมินที่บอกสาเหตุของความล้มเหลว ไม่ใช่แค่จุดที่ผิด เช่น CRAFT ที่ใช้ rubric criteria เป็น probe; (2) คลังทักษะขนาดใหญ่และวิธีเลือกทักษะเชิงโครงสร้าง เช่น SkillCenter (216k+ skills) และ SkillDAG ที่ใช้ typed graph; (3) การปรับปรุง deep search และ multi-step reasoning เช่น SearchEyes (knowledge graph simulate search world), TreeSeeker (tree-structured trial-and-error), LongSeeker (context orchestration), DailyReport (benchmark daily search), และ SCALE (self-cognitive exploration) รวมถึง Web2BigTable สำหรับ structured extraction และ PersonaTrail สำหรับ personalization จาก browsing history งานเหล่านี้ให้แนวทางปฏิบัติที่ dev, PM และ founder สามารถเอาไปปรับใช้ในการพัฒนา agent evaluation pipeline, skill library, และ search agent ของตัวเองได้ทันที
งานวิจัยใหม่ชี้ LLM agents สำหรับ Root Cause Analysis ใน microservices ยังมีปัญหาเรื่องความแม่นยำและ context contamination
งานวิจัยล่าสุดจาก arXiv หลายชิ้นชี้ให้เห็นว่า LLM agents ที่ใช้ทำ Root Cause Analysis (RCA) ในระบบ microservices ยังเจอปัญหาใหญ่ ทั้งความแม่นยำต่ำเมื่อเจอ telemetry จริงจาก dataset อย่าง OpenRCA, การสะสม error ใน pipeline ที่ทำให้ผลลัพธ์สุดท้ายเพี้ยน, และ context contamination เมื่อ agent retry แล้วเอาความล้มเหลวครั้งก่อนกลับมาปนใน context ทำให้ error rate สูงขึ้น มีการเสนอ frameworks แก้ เช่น STAR ที่แบ่ง RCA workflow เป็น 4 stages แล้วซ่อม trace ที่ผิด, TopoEvo ที่ใช้ topology awareness เพื่อลด symptom-amplification bias, และ CCRM model ที่อธิบาย context contamination อย่างเป็นทางการ
นักวิจัยเผย 7 งานใหม่ด้านความปลอดภัย LLM เน้น multi-turn, guardrails, safety drift
arXiv มีเปเปอร์ใหม่หลายชิ้นที่ชี้ให้เห็นว่าความปลอดภัยของ LLM ในโลกจริงยังมีช่องโหว่เยอะ โดยเฉพาะเมื่อโมเดลต้องคุยหลายรอบ (multi-turn) หรือทำงานเป็น agent ใช้ tools มีงานที่พบว่า safety alignment ค่อย ๆ เสื่อมลงระหว่างการสนทนา (safety drift) และโมเดลส่วนใหญ่ยังตรวจจับอันตรายจากหลายเซนเซอร์พร้อมกันไม่ได้ดีพอ งานอื่นเสนอแนวทางป้องกัน เช่น ใช้ small language model (SLM) เป็น guardrail แยก หรือใช้ latent reasoning เพื่อลด latency ขณะที่ยังตรวจจับ prompt อันตรายได้แม่นยำขึ้น นอกจากนี้ยังมี benchmark ใหม่สำหรับการใช้งานทางทหารและหุ่นยนต์พยาบาล ซึ่งเผยว่า violation rate สูงถึง 54%
arXiv เผย 9 งานวิจัย Neuro-Symbolic AI เน้นแก้ reasoning และ compositionality
มีงานวิจัยใหม่จาก arXiv หลายชิ้นที่พยายามแก้จุดอ่อนของ neural network โดยเฉพาะเรื่อง reasoning และ compositional generalization ด้วยแนวทาง neuro-symbolic ที่ผสม neural learning กับ symbolic logic งานเด่นๆ เช่น การใช้ probability กับ intensional logic เพื่อจัดการกับ unknown sentences, การ integrate answer set programming กับ energy based models สำหรับ joint optimization, และการวิเคราะห์ reasoning shortcuts ที่ทำให้ระบบ neuro-symbolic เรียนรู้ constraint โดยไม่เข้าใจ concept จริงๆ นอกจากนี้ยังมีงานที่เสนอ OPT* สำหรับ optimization-like reasoning ใน LLM, NSI สำหรับ skill induction แบบ logic-grounded, และ VeriSimpl ที่ใช้ simplification-based verification แปลง natural language เป็น optimization formulation โดยรวมแล้ววงการกำลังหาทางทำให้ AI reasoning แข็งแรงขึ้นและตีความได้มากขึ้น
7 งานวิจัยใหม่ชี้ LLM มีข้อจำกัดด้านความหลากหลาย ความเสี่ยง และอคติ dev ต้องปรับวิธีใช้ ensemble และ temperature
งานวิจัยล่าสุดจาก arXiv หลายชิ้นชี้ให้เห็นว่า LLM มีพฤติกรรมที่ซับซ้อนกว่าที่คิด การสุ่ม temperature สูงไม่ได้ให้ความหลากหลายเทียบเท่าการใช้ ensemble หลายโมเดล (Marchenko-Pastur test ยืนยัน) LLM ยังแสดง risk attitude ที่สม่ำเสมอข้ามโดเมน (navigation, triage, finance) และมี normative conformity bias ที่อาจบิดเบือนผลใน multi-agent systems นอกจากนี้ยังพบอคติทางภูมิรัฐศาสตร์ที่ฝังใน safety guardrail และความสามารถในการปรับ personalization ที่ยังจำกัด สำหรับ dev และ PM ที่ใช้ LLM ใน production ต้องระวังเรื่องการเลือก temperature, การใช้ ensemble, และการออกแบบ prompt ที่ลด conformity bias
Meta ใช้ AI สร้าง clickbait ใน Meta AI app Mosseri บอกผู้ใช้ไม่ชอบก็เลื่อนผ่าน
Meta เปิดตัว For You section ใน Meta AI app ที่ป้อนบทความ clickbait สร้างโดย AI ทั้งหัวข้อ รูป และเนื้อหา ขณะที่ Adam Mosseri หัวหน้า Instagram ให้สัมภาษณ์ว่าเขาไม่เห็นด้วยกับการกรอง AI content ออกจากฟีด แต่ถ้าผู้ใช้ไม่ชอบก็ควรเลื่อนผ่านหรือกดไม่สนใจเอง ด้านงานวิจัยล่าสุดจาก arXiv เสนอ ClickGuard ซึ่งเป็น browser extension ที่ใช้ XGBoost ร่วมกับ transformer embeddings ตรวจจับ clickbait ได้ F1 91% ชี้ว่าการใช้ LLM embeddings ช่วยเพิ่ม accuracy ได้ดีกว่า vectorizer แบบดั้งเดิม
งานวิจัย 2 ชิ้นชี้ watermark และ benchmark ทั่วไปอาจไม่ปลอดภัยพอสำหรับ LLM ทางการแพทย์
มีงานวิจัยจาก arXiv สองชิ้นที่เตือน dev และ PM ที่ทำ product ด้านการแพทย์เกี่ยวกับข้อจำกัดของการประเมิน LLM แบบเดิม ชิ้นแรกทดสอบ 5 watermarking schemes บน 11 LLM และ 7 VLM พบว่า watermark ที่เปลี่ยน token เล็กน้อยในบริบททางการแพทย์ทำให้ความหมายเพี้ยนจนอันตรายได้ ชิ้นที่สองเสนอ framework stress-test ชื่อ AI-MASLD ที่ใช้ 240 clinical cases พร้อม perturbation probes 6 แบบ พบว่า benchmark accuracy ปกติไม่สามารถตรวจจับ failure modes ที่เป็นอันตรายได้ เช่น การ flip คำตอบเมื่อเปลี่ยนบริบทนิดเดียว หรือ bias ต่อกลุ่มคนไข้บางกลุ่ม ทั้งสองชี้ว่าถ้าจะ deploy LLM ในคลินิก ต้องมี evaluation เฉพาะทางที่ sensitive กว่าแค่ accuracy บน benchmark ทั่วไป
NVIDIA เปิด Nemotron 3 Ultra 550B, Cosmos 3 world model และระบบ post-training อัตโนมัติ
NVIDIA ปล่อยของหนักสัปดาห์นี้ทั้ง Nemotron 3 Ultra โมเดล 550B-A55B ที่หลายคนบอกว่าเป็น open-weight LLM ที่แรงที่สุดใน US ตอนนี้, Cosmos 3 world model แบบ Mixture-of-Transformers ที่รวม language/image/video/audio/action ไว้ในโมเดลเดียว มีให้เลือกทั้ง Nano 16B และ Super 64B พร้อม finetune สำหรับ Text2Image และ Image2Video ที่ขึ้นอันดับ 1 ใน leaderboard ของ Artificial Analysis, และ Nemotron 3 Nano Omni สำหรับ multimodal agent ที่รองรับ document/audio/video context ยาว นอกจากนี้ยังมีระบบ autonomous post-training ที่วน loop ปรับปรุงโมเดลเองโดยไม่ต้องมีมนุษย์คอยปรับ ซึ่งทำ Nemotron 30B ได้คะแนน 0.86 ใกล้เคียง human submission ที่ 0.87 บน Nemotron-Reasoning Challenge
Lovable สตาร์ทอัพ vibe-coding สัญชาติสวีเดน โตทะลุ $500M ARR เตรียมระดมทุน $300M ที่มูลค่า $13.2B
Lovable สตาร์ทอัพ vibe-coding จากสวีเดน เปิดเผยว่าตอนนี้มีรายได้ต่อปีแบบ annualized run rate เกิน $500 ล้านแล้ว และมีโปรเจกต์ใหม่ถึง 1 ล้านโปรเจกต์ต่อสัปดาห์ ส่วนใหญ่เป็นคนที่ไม่ใช่ developer ใช้สร้างเว็บ ระบบ CRM หรือ e-commerce ของตัวเอง บริษัทยังอยู่ในระหว่างเจรจาระดมทุน $300 ล้านที่มูลค่า $13.2 พันล้าน ซึ่งเพิ่มขึ้นเท่าตัวจากรอบก่อนเมื่อธันวาคมปีที่แล้ว นอกจากนี้ Lovable ยังเพิ่งลงทุนใน Atech สตาร์ทอัพที่อยากทำให้ vibe-coding ใช้กับฮาร์ดแวร์ได้ และมีนโยบายขึ้นเงินเดือนพนักงานปีละ 10% อัตโนมัติ ซึ่งสะท้อนว่าบริษัทกำลังเติบโตเร็วมากและแชร์ผลกำไรกลับสู่ทีม
Runway เปิดตัว Media Router เลือกโมเดลสร้างภาพ/วิดีโอ/เสียงอัตโนมัติ
Runway เปิดตัว Media Router บนแพลตฟอร์ม Runway Dev ซึ่งเป็น API สำหรับนักพัฒนาที่ต้องการใช้ generative media โดย router จะเลือกโมเดลที่ดีที่สุดให้โดยอัตโนมัติตาม priority ด้าน quality, speed หรือ cost รองรับโมเดลของ Runway และ third-party รวมถึงโมเดลจีนที่กำลังได้รับความนิยม แต่ธุรกิจสามารถตั้งค่ากำหนดผู้ให้บริการตามภูมิภาคได้ ถือเป็นก้าวแรกของ model routing ในวงการ generative media ที่กำลังแออัด
Meta ปล่อยโฆษณา AI มองโลกแง่ดี แต่ใช้เพลง David Bowie ที่พูดถึงวันสิ้นโลก
Meta เปิดตัวโฆษณาชุดใหม่บน Instagram ที่พยายามสื่อว่า AI จะไม่ทำให้คนโดดเดี่ยวหรือถูกทิ้งไว้ข้างหลัง แต่กลับใช้เพลง "Five Years" ของ David Bowie เป็น soundtrack ซึ่งเนื้อเพลงจริง ๆ พูดถึงการที่โลกกำลังจะแตกในอีกห้าปีข้างหน้า ทั้ง TechCrunch และ WIRED ชี้ให้เห็นถึงความไม่สอดคล้องนี้ Meta อ้างคำพูดของ Bowie ในปี 1972 ที่บอกว่าเพลงนี้เกี่ยวกับการมองโลกในแง่ดีเกี่ยวกับอนาคต แต่แหล่งข้อมูลอื่น ๆ รวมถึง BowieBible ยืนยันว่าเพลงพูดถึง dystopian nightmare และความตื่นตระหนกก่อนวันสิ้นโลก
Adobe, Canva, Anthropic เปิด AI assistant และ workflow-first ในเครื่องมือสร้างสรรค์
หลายบริษัทกำลังผลักดัน AI เข้าสู่เครื่องมือสร้างสรรค์แบบ workflow-first Adobe เปิด AI assistant ใน Photoshop, Premiere, Illustrator และ Firefly studio ที่จำบริบทโปรเจกต์ได้ Canva อัปเดต AI 2.0 ใช้ prompt-based editing Anthropic เปิด Claude connectors สำหรับ Photoshop, Blender, Ableton และ voice mode สำหรับ Opus/Sonnet OpenAI อัปเดต image generator 2.0 ที่ค้นหาเว็บได้ FL Studio 2026 ให้ Gopher AI ช่วยเป็น assistant engineer แนวโน้มนี้สอดคล้องกับ multimodal AI wave ที่สามที่เน้น workflow-first มากกว่าแค่สร้างไฟล์เดี่ยว
AMD เปิดตัว Ryzen PRO 9000 series พร้อม 3D V-Cache สำหรับ workstation ครั้งแรก
AMD ประกาศ Ryzen PRO 9000 series สำหรับ workstation โดยใช้ Zen 5 และเพิ่ม 3D V-Cache เป็นครั้งแรกในไลน์นี้ รุ่นท็อปคือ Ryzen 9 Pro 9965X3D 16 cores 32 threads แคช L3 128MB ส่วน Ryzen 7 Pro 9755X3D ได้ 8 cores 104MB รองรับ ECC DDR5 สูงสุด 256GB, PCIe 5.0 และชุดฟีเจอร์ Pro Technologies เน้นงานตัดต่อ 4K/8K, 3D modelling, rendering และ AI inference เฉพาะเครื่อง OEM อย่าง Lenovo ThinkStation P4 ที่จะออก Q3 2026
Amazon และกองทัพสหรัฐเจอปัญหา tokenmaxxing พนักงานใช้ AI เกินจำเป็น
ทั้ง Amazon และกองทัพสหรัฐกำลังเจอปัญหาเดียวกันคือพนักงานใช้ AI อย่างสิ้นเปลืองเพื่อให้ผ่าน quota หรือ leaderboard บริษัท โดย Amazon กดดันให้ dev ใช้ AI สัปดาห์ละ 80% จนเกิดพฤติกรรม tokenmaxxing สร้าง agent ทำงานไม่จำเป็นเพื่อเพิ่ม token consumption ส่วนกองทัพสหรัฐใช้ token หมดทั้งปีในเดือนเดียวเพราะพนักงานถูกกดดันให้ใช้ AI มากขึ้น ส่งผลให้ต้นทุน AI พุ่งสูงโดยไม่คุ้มค่า
Forbes Tech Council ชี้สร้าง trust ในยุค AI ต้องออกแบบเพื่อความไว้วางใจ ไม่ใช่แค่ฟีเจอร์
Forbes รวบรวมมุมมองจาก CTO และผู้บริหารเทคโนโลยี 5 คน เกี่ยวกับความสำคัญของ trust ในระบบดิจิทัลยุค AI ทั้งในมุม product (search, checkout, branded communication), การนำเทคโนโลยีใหม่มาใช้ในองค์กร (change management, decision visibility), และระบบ automation (automation trust tax ที่เกิดจากมนุษย์ไม่ไว้ใจระบบจนต้อง manual override) ทุกคนเห็นตรงกันว่า trust ไม่ใช่ soft skill แต่เป็น economic driver ที่วัดผลได้ ถ้าไว้ใจกัน ต้นทุนลด ความเร็วเพิ่ม ถ้าไม่ไว้ใจ เกิด friction และ oversight ที่แพงกว่าเดิม
AI ยังไม่น่าเชื่อถือพอสำหรับงานสำคัญ ปัญหาอยู่ที่ context และการตรวจสอบ ไม่ใช่แค่โมเดล
บทความจาก Forbes และ Digital Trends ชี้ว่าแม้โมเดล AI จะเก่งขึ้นเรื่อย ๆ แต่ความเชื่อมั่นของผู้ใช้กลับลดลง เพราะปัญหาที่แท้จริงไม่ใช่ performance แต่คือ context AI ไม่เข้าใจบริบทของงานที่ทำ, ไม่มี traceability ที่ regulator ต้องการ, และไม่สามารถ verify ข้อมูลที่ใช้ตัดสินใจได้ โดยเฉพาะในสายงานที่มีความเสี่ยงสูงอย่างการแพทย์ กฎหมาย การเงิน หรือการพาณิชย์แบบ agentic การซื้อ AI testing tools หรือการพึ่งพาโมเดลที่ดีขึ้นเพียงอย่างเดียวไม่พอ ถ้าไม่มีกระบวนการตรวจสอบที่ออกแบบมาเฉพาะสำหรับ probabilistic system
AI data center คาดกินไฟสหรัฐฯ 20% ในปี 2035 หลายรัฐเริ่มจำกัดก่อสร้าง
BloombergNEF รายงานว่าภายในปี 2035 data center ในสหรัฐฯ จะใช้ไฟฟ้าเกือบหนึ่งในห้าของทั้งประเทศ ซึ่งเป็น 4 เท่าของวันนี้ โดยเกือบครึ่งของกำลังการผลิตใหม่ 200 GW จะใช้สำหรับเทรนและ inference AI โครงข่ายไฟฟ้าหลายแห่งตึงตัวอยู่แล้ว เช่น PJM ต้องจัดสรร 34% ของกำลังการผลิตให้ data center ในขณะเดียวกัน นิวยอร์กกลายเป็นรัฐแรกที่สั่งพักใบอนุญาต data center ใหญ่เป็นเวลา 1 ปี ส่วนยูทาห์เพิ่งอนุมัติ Stratos Project ขนาด 40,000 เอเคอร์ที่ใช้ไฟ 9 GW ซึ่งมากกว่าทั้งรัฐ ความกังวลเรื่องค่าไฟ สิ่งแวดล้อม และน้ำทำให้ชุมชนหลายแห่งเริ่มต่อต้าน และอีกหลายรัฐกำลังพิจารณามาตรการคล้ายกัน
Trump Media ลดสเกล Truth Predict Volume ส่วนใหญ่ของตลาดคาดการณ์คือการพนัน
ข่าวนี้รวบรวมสามมุมมองของ prediction markets ในปี 2026 WIRED รายงาน Trump Media ถอยจากแผนเดิมที่จะเปิด Truth Predict ร่วมกับ Crypto.com เหลือแค่ marketing deal กับ OG.com Forbes มองว่า event-driven signals จากตลาดคาดการณ์ให้ price discovery เร็วกว่าตลาดดั้งเดิม ส่วน Y Combinator ชี้ข้อมูล volume 90% ของ Kalshi และ 80% ของ Polymarket เป็น sports/crypto/election betting ไม่ใช่ข้อมูลที่ช่วยตัดสินใจได้จริง หมายความว่าตลาดคาดการณ์ยังห่างจากเป้าหมายเดิมที่ว่าจะเป็นข้อมูลสาธารณะที่มีประโยชน์