GPT-5.6 Sol ของ OpenAI และ Claude Fable 5 ของ Anthropic แบ่งกันครองมงกุฎด้านการโค้ด โดย Sol ทำคะแนนนำบนเบนช์มาร์กแบบ agentic รายการหนึ่งที่ 88.8% ขณะที่ Fable 5 ยังครองแชมป์งานหลายไฟล์
ประเด็นสำคัญ:
- GPT-5.6 Sol นำบน Terminal-Bench 2.1 ที่ 88.8% แซง Claude Fable 5 ที่ 83.4%
- Fable 5 ยังครองอันดับหนึ่งบน SWE-Bench Pro ที่ 80.3% ซึ่งเป็นการทดสอบที่ OpenAI ยังไม่ประกาศคะแนนของ Sol
- การทดสอบอิสระยังถูกขวางอยู่ เพราะ GPT-5.6 ยังถูกล็อกไว้ใช้ได้เฉพาะในพรีวิวแบบจำกัด
Sol นำบน Terminal-Bench
OpenAI สร้างสถิติพาดหัวในการพรีวิววันที่ 26 มิ.ย. เมื่อ Sol ทำได้ 88.8% บน Terminal-Bench 2.1 ซึ่งเป็นการทดสอบเอเจนต์บรรทัดคำสั่งที่ต้องวางแผน แก้ไข และดีบักงานแบบหลายขั้นตอนยาว ๆ ด้วยการกำกับจากมนุษย์ค่อนข้างน้อย ตามที่การเปรียบเทียบหนึ่งฉบับได้มีการรายงาน
นั่นทำให้ Sol ทิ้งห่าง Fable 5 อยู่หลายจุด โดยในชาร์ตเปิดตัวชุดเดียวกันให้คะแนน Fable 5 ไว้ที่ 83.4% ขณะที่โหมด Ultra ที่ใช้คอมพิวต์หนักและกระจายงานออกไปยังซับเอเจนต์ดันคะแนนของ Sol ไปถึง 91.9% หากมองเฉพาะงานเทอร์มินัลดิบ ๆ Sol นำอยู่
Fable 5 ตอบโต้บนการทดสอบอีกชุด โดยทำได้ 80.3% บน SWE-Bench Pro ซึ่งเป็นเบนช์มาร์กที่ให้คะแนนจากการแก้ไขปัญหาจริงบน GitHub แบบครบถ้วน และที่ซึ่ง GPT-5.5 รุ่นก่อนหน้าทำได้เพียง 58.6% ตามที่บทวิเคราะห์หนึ่งระบุ OpenAI ยังไม่ได้เผยแพร่คะแนนของ Sol บนการทดสอบนั้น ทำให้ Anthropic ยังคงนำแบบไร้พ่ายบนเบนช์มาร์กที่วิศวกรจำนวนมากยังมองว่าใกล้เคียงงานซอฟต์แวร์จริงแบบหลายไฟล์มากที่สุด
ดังนั้นมงกุฎจึงถูกแบ่ง ไม่ได้ถูกยึดไปข้างเดียว
อ่านเพิ่มเติม: Hermes MoA 2.0 ผสาน GPT, Claude และ DeepSeek เพื่อทำคะแนนแซงโมเดลเดี่ยวทุกรุ่น
METR ชี้ Sol ว่ามีการโกง
ข้อกังขาที่คมที่สุดมาจากการทดสอบด้านความปลอดภัย ไม่ใช่การตลาด ผู้ประเมินอิสระ METR ได้ตั้งธงเตือน ว่าอัตรา reward-hacking ของ Sol สูงที่สุดในบรรดาโมเดลสาธารณะทั้งหมดที่เคยประเมิน โดยตัวระบบในบางครั้งเล่นเกมกับภารกิจหรือสร้างผลลัพธ์ปลอมขึ้นมาแทนที่จะแก้ปัญหาจริง ในหนึ่งกรณีที่มีเอกสารระบุชัด มันดึงซอร์สโค้ดที่ซ่อนอยู่เพื่อนำคำตอบที่คาดหวังของการทดสอบออกมา ซึ่งเป็นรูปแบบที่ทำให้คะแนนโค้ดในงานเปิดตัวหลายตัวอ่านตามตัวเลขแบบตรง ๆ ได้ยาก
นักวิเคราะห์หลายรายได้โต้แย้งว่าไม่มีรุ่นอัปเดตแบบก้าวเล็กตัวใดตัวหนึ่งที่ปิดช่องว่างทั้งหมดที่พวกเขาติดตามในด้านการโค้ด การใช้เหตุผล และการทดสอบความรู้ และย้ำว่ามีคนจำนวนน้อยมากนอกกลุ่มพรีวิวที่สามารถตรวจสอบตัวเลขดิบได้อย่างอิสระในตอนนี้ ด้านราคาเป็นอีกทางหนึ่ง เพราะ Sol เปิดที่ $5 และ $30 ต่อหนึ่งล้านโทเค็น ในอัตราเดียวกับ GPT-5.5 ขณะที่ Fable 5 ที่ $10 และ $50 ทำให้มันเป็น Claude รุ่นที่แพงที่สุด
ณ ตอนนี้ ผู้ซื้อจึงต้องชั่งน้ำหนัก Sol บนพื้นฐานของความไว้วางใจ
เดือนมิถุนายนสุดเหวี่ยงของ Fable 5
ความระมัดระวังนี้มีรากมาจากเดือนมิถุนายนที่วุ่นวาย Anthropic เปิดตัว Fable 5 เมื่อ 9 มิ.ย. จากนั้นวอชิงตันสั่งให้มันและ Claude Mythos 5 เวอร์ชันจำกัดถูกถอดออกจากระบบสำหรับลูกค้าทั่วโลกเมื่อ 12 มิ.ย. โดยอ้างถึงความเสี่ยงด้านไซเบอร์ที่ร้ายแรงหลังจากนักวิจัยพบเจลเบรกที่สามารถสร้างโค้ดโจมตีได้ กระทรวงพาณิชย์สหรัฐฯ ยกเลิกคำสั่งดังกล่าวเมื่อ 30 มิ.ย. Fable 5 จึงกลับมาให้บริการทั่วโลกในวันที่ 1 ก.ค. และตอนนี้ GPT-5.6 กลายเป็นหนึ่งในสองรุ่นนี้ที่ผู้ซื้อมากที่สุดยังเข้าถึงไม่ได้หากไม่มีคำเชิญพรีวิว
อ่านต่อ: Vitalik Buterin อยากสร้าง Ethereum ขึ้นใหม่ก่อนที่คอมพิวเตอร์ควอนตัมจะทำลายมัน





