Grok 4.5 ช่วยหนุนข้ออ้างด้าน “คุ้มค่า–คุ้มราคา” ของ Elon Musk หลังคว้าอันดับหนึ่งในการจัดอันดับประสิทธิภาพเอเจนต์ AI โดยผู้ประเมินอิสระ
ประเด็นสำคัญ:
- Grok 4.5 ทำคะแนนได้ 51.4% บน AutomationBench-AA แซงหน้าโมเดล Claude สองรุ่น
- ต้นทุนโมเดลอยู่ที่ 0.34 ดอลลาร์ต่อหนึ่งงาน ต่ำกว่าคู่แข่งจาก Anthropic อย่างมีนัยสำคัญ
- อัตราการฝ่าฝืนกฎ (guardrail violations) ที่สูงกว่ายังคงเป็นความเสี่ยงต่อการใช้งานเอเจนต์ระดับองค์กร
คะแนนเบนช์มาร์กของ Grok
Artificial Analysis เปิดเผย ว่า Grok 4.5 ทำคะแนนบน AutomationBench-AA ได้ 51.4% นำหน้า Claude Fable 5 ที่ 48.6% และ Claude Opus 4.8 ที่ 48.5%
ด้านต้นทุน Grok 4.5 ใช้ค่าใช้จ่ายเพียง 0.34 ดอลลาร์ต่อหนึ่งงาน ต่ำกว่าคู่แข่งอย่าง Fable 5 ที่ 1.35 ดอลลาร์ และ Opus 4.8 ที่ 1.46 ดอลลาร์ ต่อหนึ่งงานอย่างมาก
ผลทดสอบนี้จึงทำหน้าที่เป็นการยืนยันจากภายนอกต่อคำกล่าวอ้างของ Musk ว่า Grok 4.5 เป็นโมเดลระดับ Opus ที่ทำงานได้เร็วกว่าและต้นทุนต่ำกว่า SpaceXAI เพิ่งเปิดให้ใช้งานสาธารณะในสัปดาห์นี้ โดยใช้โมเดลฐาน V9 ขนาด 1.5 ล้านล้านพารามิเตอร์ พร้อมอ้างผลประเมินภายในระยะแรกเพื่อรองรับการเปิดตัว
AutomationBench-AA ใช้ชุดงาน 657 งาน ครอบคลุมแอปจำลอง 40 ตัว เช่น Gmail, Slack, Salesforce และ HubSpot การทดสอบเน้นดูว่าเอเจนต์ AI สามารถทำภารกิจให้สำเร็จโดยไม่ฝ่าฝืน guardrails หรือไม่ ขณะที่ Artificial Analysis เก็บชุดงานไว้เป็นความลับเพื่อลดโอกาส “ท่องข้อสอบ” จากเบนช์มาร์ก
อ่านเพิ่มเติม: Grok 4.5 ท้าชน OpenAI และ Anthropic ด้วย Agentic AI ราคาย่อมเยา
คำท้าทายของ Musk
Artificial Analysis ระบุว่า Grok 4.5 ใช้โทเคนเอาต์พุตราว 8,000 โทเคนต่อหนึ่งงาน คิดเป็นประมาณหนึ่งในสี่ของ Opus 4.8 “การใช้โทเคนรวมเพียง 0.44 ล้านโทเคนต่อหนึ่งงานถือว่าต่ำที่สุดกลุ่มบนตารางจัดอันดับ” บริษัทชี้ พร้อมเสริมว่าต้นทุนที่ต่ำเกิดจากทั้งประสิทธิภาพการใช้โทเคนและโครงสร้างราคาโทเคน
Grok 4.5 ทำภารกิจได้สำเร็จตามวัตถุประสงค์ 79.9% และผ่านครบทุกเงื่อนไข 21.9% ของงานทั้งหมด ในหมวดการเงินซึ่งเป็นโดเมนที่ยากที่สุดของเบนช์มาร์ก Grok 4.5 ทำได้ดีที่สุดที่ 71% เทียบกับ Fable 5 ที่ 64% และ Opus 4.8 ที่ 62%
จุดอ่อนอยู่ที่ด้านคอมพลายอันส์ Grok 4.5 มีการฝ่าฝืน guardrails เฉลี่ย 0.63 ครั้งต่อหนึ่งงาน สูงกว่า Opus 4.8 ที่ 0.55 และ Google Gemini 3.5 Flash ที่ 0.46 ความแตกต่างในมิติ “ไม่หลุดกรอบ” นี้มีความสำคัญอย่างยิ่งสำหรับองค์กรที่ต้องการใช้เอเจนต์เชื่อมต่อใกล้กับระบบการเงินจริง
สำหรับการเปิดตัวครั้งนี้ Musk เลือกเน้น “การแลกเปลี่ยนเชิงปฏิบัติ” มากกว่าการชนะทุกมิติของเบนช์มาร์ก Grok 4.5 ได้รับการยืนยันจากภายนอกแล้วในด้านต้นทุนและความเร็ว แต่สถิติการละเมิดกฎที่สูงกว่ายังคงชี้ให้เห็นว่าการยอมรับในระดับองค์กรจะขึ้นกับคำตอบเรื่อง “ความน่าเชื่อถือ” เป็นสำคัญ
อ่านต่อ: Bitcoin ฟื้นตัวแต่ดีมานด์สะดุด สัญญาณที่ฝั่งกระทิงมองข้ามไม่ได้





