มุมมองแตกขั้วต่อ Claude Opus 5 หลังผลทดสอบอิสระรอบแรก

มุมมองแตกขั้วต่อ Claude Opus 5 หลังผลทดสอบอิสระรอบแรก

ผู้ทดสอบอิสระให้คะแนนโมเดลใหม่ของ Anthropic อย่าง Claude Opus 5 ที่ 159 บนดัชนีความสามารถหนึ่งชุด ต่ำกว่า Claude Fable 5 อยู่สองคะแนน ขณะที่ความเห็นต่อผลงานรีวิวโค้ดแตกขั้วอย่างชัดเจน

ประเด็นสำคัญ

  • Epoch AI ให้คะแนน Claude Opus 5 ที่ 159 บนดัชนีความสามารถ เทียบกับ 161 ของ Claude Fable 5 โดยสองโมเดลทำคะแนนด้านวิศวกรรมซอฟต์แวร์สูสีกัน
  • CodeRabbit วัด precision ของคอมเมนต์รีวิวโค้ดที่นำไปใช้ได้จริงที่ 39.3% จากค่าอ้างอิง 35.2% แต่จำนวนคอมเมนต์จุกจิก (nitpick) พุ่งขึ้น 4 เท่า
  • ฝั่งองค์กรอย่าง Cognition และ Zapier รายงานว่าโมเดลใหม่ช่วยดีบักและทำออโตเมชันเชิงธุรกิจแบบ end-to-end ได้ดีขึ้น

คะแนน Benchmark ของ Claude Opus 5 ถูกจับตาตั้งแต่รอบแรก

Anthropic ปล่อยโมเดลนี้เมื่อวันศุกร์ที่ผ่านมา และระบุว่า Opus 5 เข้าใกล้ระดับ “frontier intelligence” ของ Fable 5 แต่คิดค่าบริการเพียงครึ่งเดียว พร้อมวางตำแหน่งให้เป็นโมเดลสำหรับงานประจำวันมากกว่าตัวผู้เชี่ยวชาญเฉพาะทาง ผลทดสอบจากภายนอกส่วนใหญ่ก็สอดคล้องในภาพรวม แม้จะต่างกันบนรายละเอียดเชิงตัวเลข

Epoch AI ให้คะแนน Opus 5 ที่ 159 บนดัชนีความสามารถ เทียบกับ 161 ของ Fable 5 และระบุว่าทั้งสองตัวทำคะแนนด้านวิศวกรรมซอฟต์แวร์ใกล้เคียงกัน ตามสรุปโดย Latent Space ที่เผยแพร่

ด้าน Artificial Analysis จัดอันดับ Opus 5 เป็นที่หนึ่งบน benchmark งานความรู้เชิงเอเจนต์ แซง Fable 5 ไปเกือบ 150 Elo ขณะเดียวกันยังลดต้นทุนต่อหนึ่งงานลงได้ราว 20% นักพัฒนาบางส่วนกลับไม่เห็นด้วยกับการใช้คะแนนดัชนีความสามารถเดียวชี้วัดทั้งหมด โดยมองว่าการขยับจาก Opus 4.8 เพียง 1 คะแนน ไม่สะท้อนช่องว่างด้านประสบการณ์ใช้งานจริงที่พวกเขาเห็นทุกวัน หนึ่งในผู้ประเมินยังพบว่าโหมด “medium effort” ให้ผลทดสอบโค้ดดีกว่าระดับความพยายามที่สูงกว่า

อ่านเพิ่มเติม: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight

ผลรีวิวโค้ดยังคงแบ่งขั้ว

CodeRabbit นำ Opus 5 ไปทดสอบกับแพตเทิร์นบั๊กจริงราว 100 รูปแบบจาก pull request ของโอเพ่นซอร์ส โดยรันสามรอบต่อคอนฟิก และวัดผลได้ precision ของคอมเมนต์ที่แก้ไขได้จริงที่ 39.3%

ตัวเลขดังกล่าวเหนือกว่าค่าอ้างอิง 35.2% ที่ตั้งจากรีวิวเวอร์ตัวจริงในระบบโปรดักชัน แต่ในอีกด้าน โมเดลกลับจับบั๊กที่ยืนยันแล้วได้น้อยลง และสร้างคอมเมนต์จุกจิกเพิ่มขึ้นถึงสี่เท่า ซึ่งกลายเป็นภาระที่วิศวกรต้องมาคัดกรองเอง

ในโหมดความพยายามเริ่มต้น (default effort) precision ร่วงลงเหลือ 26.4% สรุปของบริษัทคือ ทีมงานควรมอง Opus 5 เป็น “รีวิวเวอร์ตัวที่สอง” ที่เน้นความแม่นยำ มากกว่าจะเป็นการอัปเกรดตรง ๆ แทนระบบที่รีวิวเวอร์เดิมทำงานได้ดีอยู่แล้ว Claire Vo ซึ่งดูแลเฟรมเวิร์กประเมินโมเดล 7 ตัวสำหรับทีมโปรดักต์ ให้ความเห็นว่าโมเดล “ฉลาดมากแต่ชวนหงุดหงิด” พร้อมยกตัวอย่างนิสัยจู้จี้ และเคสที่โมเดลปฏิเสธจัดการ merge conflict แบบแข็งกร้าว

ลูกค้า Anthropic ชี้ศักยภาพด้านเอเจนต์เพิ่มขึ้น

Scott Wu ซีอีโอของ Cognition ระบุว่า ภายในผลิตภัณฑ์ Devin นั้น Opus 5 เข้าใกล้ประสิทธิภาพระดับ Fable ที่ต้นทุนเพียงครึ่งหนึ่ง โดยโดดเด่นเป็นพิเศษด้านดีบักและการวิเคราะห์หาต้นตอปัญหา (root-cause analysis) ขณะที่ Wade Foster ผู้บริหารสูงสุดของ Zapier กล่าวว่า โมเดลตัวใหม่นี้ขึ้นแท่นอันดับหนึ่งบนกระดานผู้นำด้านออโตเมชันของบริษัท โดยไม่ใช้โทเคนมากกว่าเวอร์ชัน Claude ก่อนหน้า ซึ่งยังคิดราคาเท่าเดิมที่ 5 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านตัว

อย่างไรก็ดี คำชมเหล่านี้ยังมีกรอบจำกัด Anthropic ชี้ว่า Opus 5 ยังเป็นรอง Mythos 5 ในงานไซเบอร์ซีเคียวริตีเชิงรุก และคำขอที่ถูกตัวกรองความปลอดภัยของบริษัทมองว่าเสี่ยง จะถูกสลับกลับไปใช้ Opus 4.8 โดยอัตโนมัติ

ท่าทีระมัดระวังนี้เกิดขึ้นหลังช่วงผันผวนของโมเดลระดับบนสุด เนื่องจาก Fable 5 เปิดตัวเมื่อเดือนมิถุนายน ก่อนถูกถอดออกจากบริการภายในไม่กี่วัน และเพิ่งกลับมาให้ผู้ใช้เข้าถึงอีกครั้งเมื่อต้นเดือนกรกฎาคม

อ่านต่อ: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
มุมมองแตกขั้วต่อ Claude Opus 5 หลังผลทดสอบอิสระรอบแรก | Yellow