Grok 4.5 แซง Fable 5 และ Opus 4.8 ในการทดสอบ Agent AI คว้าคะแนนสูงสุด 51.4%

Grok 4.5 แซง Fable 5 และ Opus 4.8 ในการทดสอบ Agent AI คว้าคะแนนสูงสุด 51.4%

Grok 4.5 ช่วยหนุนข้ออ้างด้าน “คุ้มค่า–คุ้มราคา” ของ Elon Musk หลังคว้าอันดับหนึ่งในการจัดอันดับประสิทธิภาพเอเจนต์ AI โดยผู้ประเมินอิสระ

ประเด็นสำคัญ:

  • Grok 4.5 ทำคะแนนได้ 51.4% บน AutomationBench-AA แซงหน้าโมเดล Claude สองรุ่น
  • ต้นทุนโมเดลอยู่ที่ 0.34 ดอลลาร์ต่อหนึ่งงาน ต่ำกว่าคู่แข่งจาก Anthropic อย่างมีนัยสำคัญ
  • อัตราการฝ่าฝืนกฎ (guardrail violations) ที่สูงกว่ายังคงเป็นความเสี่ยงต่อการใช้งานเอเจนต์ระดับองค์กร

คะแนนเบนช์มาร์กของ Grok

Artificial Analysis เปิดเผย ว่า Grok 4.5 ทำคะแนนบน AutomationBench-AA ได้ 51.4% นำหน้า Claude Fable 5 ที่ 48.6% และ Claude Opus 4.8 ที่ 48.5%

ด้านต้นทุน Grok 4.5 ใช้ค่าใช้จ่ายเพียง 0.34 ดอลลาร์ต่อหนึ่งงาน ต่ำกว่าคู่แข่งอย่าง Fable 5 ที่ 1.35 ดอลลาร์ และ Opus 4.8 ที่ 1.46 ดอลลาร์ ต่อหนึ่งงานอย่างมาก

ผลทดสอบนี้จึงทำหน้าที่เป็นการยืนยันจากภายนอกต่อคำกล่าวอ้างของ Musk ว่า Grok 4.5 เป็นโมเดลระดับ Opus ที่ทำงานได้เร็วกว่าและต้นทุนต่ำกว่า SpaceXAI เพิ่งเปิดให้ใช้งานสาธารณะในสัปดาห์นี้ โดยใช้โมเดลฐาน V9 ขนาด 1.5 ล้านล้านพารามิเตอร์ พร้อมอ้างผลประเมินภายในระยะแรกเพื่อรองรับการเปิดตัว

AutomationBench-AA ใช้ชุดงาน 657 งาน ครอบคลุมแอปจำลอง 40 ตัว เช่น Gmail, Slack, Salesforce และ HubSpot การทดสอบเน้นดูว่าเอเจนต์ AI สามารถทำภารกิจให้สำเร็จโดยไม่ฝ่าฝืน guardrails หรือไม่ ขณะที่ Artificial Analysis เก็บชุดงานไว้เป็นความลับเพื่อลดโอกาส “ท่องข้อสอบ” จากเบนช์มาร์ก

อ่านเพิ่มเติม: Grok 4.5 ท้าชน OpenAI และ Anthropic ด้วย Agentic AI ราคาย่อมเยา

คำท้าทายของ Musk

Artificial Analysis ระบุว่า Grok 4.5 ใช้โทเคนเอาต์พุตราว 8,000 โทเคนต่อหนึ่งงาน คิดเป็นประมาณหนึ่งในสี่ของ Opus 4.8 “การใช้โทเคนรวมเพียง 0.44 ล้านโทเคนต่อหนึ่งงานถือว่าต่ำที่สุดกลุ่มบนตารางจัดอันดับ” บริษัทชี้ พร้อมเสริมว่าต้นทุนที่ต่ำเกิดจากทั้งประสิทธิภาพการใช้โทเคนและโครงสร้างราคาโทเคน

Grok 4.5 ทำภารกิจได้สำเร็จตามวัตถุประสงค์ 79.9% และผ่านครบทุกเงื่อนไข 21.9% ของงานทั้งหมด ในหมวดการเงินซึ่งเป็นโดเมนที่ยากที่สุดของเบนช์มาร์ก Grok 4.5 ทำได้ดีที่สุดที่ 71% เทียบกับ Fable 5 ที่ 64% และ Opus 4.8 ที่ 62%

จุดอ่อนอยู่ที่ด้านคอมพลายอันส์ Grok 4.5 มีการฝ่าฝืน guardrails เฉลี่ย 0.63 ครั้งต่อหนึ่งงาน สูงกว่า Opus 4.8 ที่ 0.55 และ Google Gemini 3.5 Flash ที่ 0.46 ความแตกต่างในมิติ “ไม่หลุดกรอบ” นี้มีความสำคัญอย่างยิ่งสำหรับองค์กรที่ต้องการใช้เอเจนต์เชื่อมต่อใกล้กับระบบการเงินจริง

สำหรับการเปิดตัวครั้งนี้ Musk เลือกเน้น “การแลกเปลี่ยนเชิงปฏิบัติ” มากกว่าการชนะทุกมิติของเบนช์มาร์ก Grok 4.5 ได้รับการยืนยันจากภายนอกแล้วในด้านต้นทุนและความเร็ว แต่สถิติการละเมิดกฎที่สูงกว่ายังคงชี้ให้เห็นว่าการยอมรับในระดับองค์กรจะขึ้นกับคำตอบเรื่อง “ความน่าเชื่อถือ” เป็นสำคัญ

อ่านต่อ: Bitcoin ฟื้นตัวแต่ดีมานด์สะดุด สัญญาณที่ฝั่งกระทิงมองข้ามไม่ได้

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
Grok 4.5 แซง Fable 5 และ Opus 4.8 ในการทดสอบ Agent AI คว้าคะแนนสูงสุด 51.4% | Yellow