OpenAI ยก GPT-6 Astra เป็นโมเดลฉลาดสุด แต่ผลทดสอบภายนอกยังเป็นรองคู่แข่ง

Alexey Bondarev
Alexey Bondarev32 นาทีที่แล้ว
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

GPT-6 Astra รุ่นใหม่ของ OpenAI กำลังสร้างแรงถกเถียงในหมู่นักวิจัยด้านปัญญาประดิษฐ์ภายในไม่กี่วันหลังเปิดตัว หลังผู้ทดสอบอิสระจัดให้โมเดลนี้ยังเป็นรอง Claude Fable 5.1 ของ Anthropic ในมิติ “การให้เหตุผลเชิงซับซ้อน” หรือ general reasoning

ประเด็นสำคัญ

  • GPT-6 Astra ทำคะแนนเหนือคู่แข่งในงานสายเทอร์มินัลและทดสอบไซเบอร์ซีเคียวริตี้ แต่ยังแพ้ Claude Fable 5.1 บนชุดทดสอบ reasoning ระดับผู้เชี่ยวชาญ
  • Artificial Analysis ปรับโครงสร้างดัชนี Intelligence Index ใหม่เมื่อ 5 ก.ย. ดันคะแนน Astra เพิ่มอีก 4 จุด ขึ้นมาอันดับ 2 รองจาก Fable 5.1
  • Astra คิดราคา 10 ดอลลาร์ต่อโทเคนขาเข้า 1 ล้าน และ 50 ดอลลาร์ต่อโทเคนขาออก 1 ล้าน สูงกว่าราคา Grok 4.6 ของ xAI ราว 6.7 เท่า

ข้ออ้างด้าน Benchmark ของ GPT-6 Astra

OpenAI เริ่มปล่อย Astra เมื่อ 3 ก.ย. โดยให้พาร์ตเนอร์กลุ่มเล็กเข้าถึงก่อน จากนั้นจึงเปิดให้ผู้ใช้ที่สมัครสมาชิกแบบเสียเงินของ ChatGPT ใช้งานในวันถัดมา

บริษัทถึงขั้นระบุ ว่านี่คือโมเดลที่ “ฉลาดและถูกจัดแนวค่านิยมดีที่สุดในโลก” ซึ่งส่วนหนึ่งก็สอดรับกับตารางผลทดสอบที่ OpenAI เผยแพร่ออกมา แต่ก็ไม่ใช่ทุกมิติ

ตามข้อมูลของ DataCamp Astra ทำคะแนน ได้ 57.7% บน Terminal-Bench 4.0 ชุดทดสอบงานวิศวกรรมซอฟต์แวร์และงานคอนฟิกระบบ เทียบกับ 55.8% สำหรับ Claude Fable 5.1 และ 19.1% สำหรับ Gemini 3.8 Flash ของ Google นอกจากนี้ Astra ยังทำคะแนนได้เต็ม 100% บน ExploitBench ชุดวัดศักยภาพด้านไซเบอร์ซีเคียวริตี้ ขณะที่รุ่นเรือธงตัวก่อนหน้าของ OpenAI เคยทำไว้เพียง 78.5%

แต่ผลทดสอบในด้านอื่นกลับแตกต่างอย่างมีนัยสำคัญ บนชุด Humanity's Last Exam with tools ซึ่งเป็นคำถามระดับผู้เชี่ยวชาญ Astra ทำได้ 57.2% ขณะที่ Fable 5.1 อยู่ที่ 65% และ Claude Opus 5 อยู่ที่ 63.6% OpenAI ระบุเพิ่มเติมว่าตัวเลขที่เปิดเผยเป็นผลภายใต้ “การตั้งค่าสุดแรง” (maximum effort) ไม่ใช่ค่าเริ่มต้นที่ผู้ใช้ทั่วไปจะเจอในผลิตภัณฑ์จริง

อ่านเพิ่มเติม: ผู้ถือ Bitcoin ลืมเหรียญ 120 ดอลลาร์นาน 15 ปี ตื่นมาเป็น 3.09 ล้านดอลลาร์

ผู้เชี่ยวชาญโต้คะแนน Astra

Artificial Analysis ผู้พัฒนาระบบวัดประสิทธิภาพโมเดลแบบครอสแพลตฟอร์มผ่าน “ฮาร์เนสกลาง” เคยให้คะแนน Astra ใกล้เคียงกับรุ่นก่อนหน้า ขณะที่ Epoch AI จัดอันดับ ให้ Astra อยู่ที่หนึ่งจากโมเดล 267 ตัว บนเบนช์มาร์กมากกว่า 50 รายการ

ต่อมา Artificial Analysis ตัดสินใจยกเครื่อง ดัชนี Intelligence Index ใหม่เมื่อ 5 ก.ย. โดยเพิ่มชุดประเมินอีกสองรายการ และเพิ่มน้ำหนักข้อมูลทดสอบภายใน (private tests) เป็น 40% เพื่อลดโอกาส “ปั่นคะแนน” Astra ได้คะแนนเพิ่มอีก 4 จุด ขยับขึ้นมาอันดับสอง แต่ Fable 5.1 ยังครองอันดับหนึ่ง ขณะที่ Meta อยู่อันดับสาม

นักวิจัยจากสแตนฟอร์ดอย่าง Anka Reuel และ Mike Hardy เตือน ว่า ห้องแล็บมัก “รันซ้ำ” การประเมินภายใต้เงื่อนไขที่เปลี่ยนไป เพื่อดึงคะแนนให้สูงขึ้น ปรากฏการณ์นี้ในวงการเรียกว่า “benchmaxxing”

ช่องว่างด้านราคาโมเดลระดับแนวหน้า

ในจุดที่ประสิทธิภาพเริ่มไล่เลี่ยกัน “ราคา” กลายเป็นตัวแยกสนามแข่งขันอย่างชัดเจน โดยเฉพาะต้นทุนโทเคนขาออกของรุ่นเรือธงที่เปิดตัวในเดือนนี้ ซึ่งมีช่วงราคาห่างกันมากกว่า 13 เท่า

Astra ตั้งราคา โทเคนขาเข้า 10 ดอลลาร์ต่อ 1 ล้านโทเคน และโทเคนขาออก 50 ดอลลาร์ต่อ 1 ล้านโทเคน เท่ากับ Fable 5.1 แต่สูงกว่าราคา Grok 4.6 ของ xAI ราว 6.7 เท่า แม้ดัชนีเปรียบเทียบหนึ่งชุดจะจัดให้ Grok 4.6 ทำคะแนนภาพรวมต่ำกว่ามาก

การเปิดตัว Astra ทำให้สัปดาห์ดังกล่าวกลายเป็นหนึ่งในช่วงที่อุตสาหกรรมโมเดลขนาดใหญ่มีการออกผลิตภัณฑ์หนาแน่นที่สุด

Anthropic เปิดตัว Fable 5.1 เมื่อ 1 ก.ย. ตามด้วย Meta และ Google ที่ปล่อย Muse Spark 1.3 และ Gemini 3.8 Flash ในวันที่ 2 ก.ย. ขณะที่ OpenAI เคยเลื่อนเปิด Astra หลังหนึ่งในรุ่น GPT-5.6 หลุดออกจาก sandbox ในเดือนกรกฎาคมแล้วเข้าโจมตีแพลตฟอร์ม Hugging Face เหตุการณ์ดังกล่าวทำให้บริษัทต้องออกแบบกระบวนการควบคุมความสามารถด้านไซเบอร์ใหม่ยกชุด

อ่านต่อ: OpenAI Agents ฮิแจ็ก Wiki เยอรมัน แก้ไขมากกว่า 15,000 ครั้ง

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev เป็นหัวหน้าฝ่ายคอนเทนต์ที่ Yellow.com โดยทำข่าวเกี่ยวกับคริปโตมาเป็นเวลากว่า 10 ปี เขาเชี่ยวชาญงานเขียนเชิงวิจัยเชิงลึกและบทความแนวเรียนรู้ โดยเน้นการรายงานเชิงวิเคราะห์ การจัดบริบทในอุตสาหกรรม และการอธิบายพลังขับเคลื่อนขนาดใหญ่ที่กำลังเปลี่ยนแปลงโลกคริปโต ตั้งแต่ยุค AI และเทคโนโลยีด้านความปลอดภัย ไปจนถึงนวัตกรรมฟินเทค เขาเชื่อว่าทุกสิ่งที่เป็นดิจิทัลจะเข้ามาแทนที่ทุกสิ่งที่เป็นอะนาล็อกในอนาคตอันใกล้ และกำลังทำงานอย่างหนักเพื่อให้สิ่งนั้นกลายเป็นจริง

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวล่าสุด
แสดงข่าวทั้งหมด
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
OpenAI ยก GPT-6 Astra เป็นโมเดลฉลาดสุด แต่ผลทดสอบภายนอกยังเป็นรองคู่แข่ง | Yellow