جروك 4.5 يتفوق على فابل 5 وأوبوس 4.8 في اختبار وكيل الذكاء الاصطناعي محققاً 51.4%

جروك 4.5 يتفوق على فابل 5 وأوبوس 4.8 في اختبار وكيل الذكاء الاصطناعي محققاً 51.4%

Grok 4.5 قدّم دعماً جديداً لادعاءات إيلون ماسك حول الكلفة والأداء، بعد أن تصدّر نموذج جروك ترتيباً مستقلاً لاختبارات وكلاء الذكاء الاصطناعي.

أبرز النتائج:

  • جروك 4.5 سجّل 51.4% على معيار AutomationBench-AA، متقدماً على نموذجين من عائلة كلود.
  • كلفة تنفيذ المهمة الواحدة بلغت 0.34 دولار فقط، وهي أقل بكثير من أقرب منافسيه من Anthropic.
  • ارتفاع معدل خرق الضوابط يجعله أكثر خطورة في نشر الوكلاء داخل بيئات المؤسسات.

أداء جروك في معيار الاختبار

شركة Artificial Analysis أوضحت أن جروك 4.5 حقق نتيجة 51.4% على معيار AutomationBench-AA، متقدماً على Claude Fable 5 الذي سجل 48.6%، وClaude Opus 4.8 الذي حصل على 48.5%. كما بلغت كلفة المهمة الواحدة باستخدام جروك 4.5 نحو 0.34 دولار، مقارنة بـ 1.35 دولار لفابل 5 و1.46 دولار لأوبوس 4.8.

هذا المعيار يوفر اختباراً خارجياً لادعاء ماسك بأن جروك 4.5 نموذج بمستوى أوبوس، مع سرعة أعلى وتكلفة أقل. SpaceXAI طرحت النموذج للعامة هذا الأسبوع، مستندة إلى نموذج أساسي V9 يضم 1.5 تريليون معامل، وإلى تقييمات داخلية مبكرة لتأطير عملية الإطلاق.

يعتمد AutomationBench-AA على 657 مهمة موزعة على 40 تطبيقاً مُحاكاة، من بينها Gmail وSlack وSalesforce وHubSpot. يراقب الاختبار قدرة وكيل الذكاء الاصطناعي على إنجاز الأهداف دون خرق ضوابط الحماية، فيما تبقي Artificial Analysis مجموعة المهام سرية لتقليل تلوث معايير القياس.

مواضيع ذات صلة: جروك 4.5 يتحدى OpenAI وAnthropic بوكيل ذكاء اصطناعي أقل تكلفة

رهان ماسك الجريء

بحسب Artificial Analysis، استخدم جروك 4.5 نحو 8,000 رمز (Token) مخرجات لكل مهمة، أي ما يعادل ربع استهلاك أوبوس 4.8 تقريباً. وقالت الشركة إن “إجمالي استخدامه من الرموز عند 0.44 مليون رمز للمهمة يعد من بين الأدنى على لوحة المتصدرين”، مشيرة إلى أن انخفاض التكلفة يعود إلى كفاءة النموذج وتسعير الرموز معاً.

النموذج تمكن من إكمال 79.9% من الأهداف الجزئية للمهام، ونجح في اجتياز 21.9% من المهام بشكل كامل. وفي مجال التمويل – وهو أصعب مجال ضمن المعيار – تصدّر جروك 4.5 بنتيجة 71%، مقابل 64% لفابل 5 و62% لأوبوس 4.8.

نقطة الضعف كانت الامتثال. فقد سجّل جروك 4.5 ما معدله 0.63 مخالفة لضوابط الحماية في كل مهمة، مقارنة بـ 0.55 لأوبوس 4.8 و0.46 لنموذج Gemini 3.5 Flash من Google؛ وهو فارق مهم للشركات التي تستخدم الوكلاء بالقرب من أنظمة مالية حية أو حساسة.

عرض ماسك الترويجي عند الإطلاق ركّز على مقايضة عملية بين الكلفة والسرعة، بدلاً من اكتساح كامل لمعايير الأداء. ورغم أن جروك 4.5 يمتلك الآن دليلاً خارجياً يدعم تفوقه في التكلفة والسرعة، فإن معدل خرق القواعد الأعلى يوضح أن تبنيه على نطاق مؤسسي سيظل مرهوناً بعنصر الاعتمادية.

اقرأ أيضاً: Bitcoin’s Recovery Has A Demand Problem Bulls Cannot Ignore

إخلاء المسؤولية وتحذير المخاطر: المعلومات المقدمة في هذا المقال مخصصة للأغراض التعليمية والإعلامية فقط وتستند إلى رأي المؤلف. وهي لا تشكل مشورة مالية أو استثمارية أو قانونية أو ضريبية. أصول العملات المشفرة شديدة التقلب وتخضع لمخاطر عالية، بما في ذلك خطر فقدان كامل أو جزء كبير من استثمارك. قد لا يكون تداول أو حيازة الأصول المشفرة مناسباً لجميع المستثمرين. الآراء المعبر عنها في هذا المقال هي آراء المؤلف (المؤلفين) فقط ولا تمثل السياسة أو الموقف الرسمي لشركة Yellow أو مؤسسيها أو مديريها التنفيذيين. قم دائماً بإجراء بحثك الشامل بنفسك (D.Y.O.R.) واستشر مختصاً مالياً مرخصاً قبل اتخاذ أي قرار استثماري.
آخر الأخبار
عرض جميع الأخبار
أخبار ذات صلة
مقالات البحث ذات الصلة
مقالات التعلم ذات الصلة
جروك 4.5 يتفوق على فابل 5 وأوبوس 4.8 في اختبار وكيل الذكاء الاصطناعي محققاً 51.4% | Yellow