«أسترا» من أوبن إيه آي تُعلن كأذكى نموذج GPT‑6… والمختبرون يختلفون

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

أوبن إيه آي تطرح نموذجها الجديد GPT‑6 Astra ليشعل الجدل في أوساط الخبراء خلال أيام من إطلاقه، بعد أن وضعته اختبارات مستقلة خلف نموذج Claude Fable 5.1 من Anthropic في قدرات الاستدلال العام.

أبرز النقاط:

  • GPT‑6 Astra يتصدر في مهام العمل على الطرفية واختبارات الأمن السيبراني، لكنه يتأخر عن Claude Fable 5.1 في معايير الاستدلال المتقدم على مستوى الخبراء.
  • شركة Artificial Analysis أعادت بناء مؤشر الذكاء الخاص بها في 5 سبتمبر، ما رفع ترتيب Astra أربع نقاط ليحتل المركز الثاني خلف Fable 5.1 مباشرة.
  • تسعير Astra يبلغ 10 دولارات لكل مليون توكن إدخال و50 دولاراً لكل مليون توكن إخراج، أي أعلى بنحو 6.7 مرات من نموذج Grok 4.6 التابع لـ xAI.

ادعاءات أوبن إيه آي حول اختبارات GPT‑6 Astra

بدأت أوبن إيه آي في طرح Astra في 3 سبتمبر، أولاً لشركاء محددين، ثم لمشتركي ChatGPT المدفوعين في اليوم التالي.

الشركة وصفت النموذج بأنه «الأذكى والأكثر مواءمة في العالم». جدول الإطلاق الذي نشرته يدعم جانباً من هذا الوصف، لكنه لا يثبته بالكامل.

وفقاً لتحليلات مستقلة، يسجل Astra نسبة 57.7% في اختبار Terminal‑Bench 4.0، الذي يقيس كفاءة العمل على الطرفية والهندسة البرمجية وتهيئة الأنظمة، مقابل 55.8% لـ Claude Fable 5.1 و19.1% فقط لنموذج Gemini 3.8 Flash من غوغل. كما حقق نتيجة 100% في اختبار ExploitBench للأمن السيبراني، حيث بلغت نتيجة النموذج الرائد السابق من أوبن إيه آي 78.5%.

لكن الصورة تختلف في اختبارات أخرى. في اختبار Humanity's Last Exam مع استخدام الأدوات، وهو حزمة أسئلة عالية التعقيد على مستوى الخبراء، يسجل Astra نسبة 57.2%، مقابل 65% لـ Fable 5.1 و63.6% لـ Claude Opus 5. وتقر أوبن إيه آي بأن الأرقام المنشورة تعكس إعدادات «أقصى جهد» لا تمثل الإعدادات الافتراضية التي سيواجهها معظم المستخدمين في المنتج الفعلي.

اطلع أيضاً: محتفظ بالبيتكوين يترك 120 دولاراً لـ 15 عاماً… ليستيقظ على 3.09 مليون دولار

جدل حول تقييمات Astra

شركة Artificial Analysis، التي تدير منصة مقارنة محايدة تمر عبرها النماذج المنافسة ضمن إطار اختبار موحد، منحت Astra في البداية تقييماً موازياً تقريباً لسلفه. في المقابل، مؤسسة Epoch AI صنّفته في المرتبة الأولى بين 267 نموذجاً عبر أكثر من 50 معياراً مختلفاً.

لاحقاً، قامت Artificial Analysis بإعادة بناء «مؤشر الذكاء» لديها في 5 سبتمبر، مضيفة تقييمين جديدين ورافعـةً وزن البيانات الخاصة في المعادلة إلى 40% لجعل التلاعب بالنتائج أكثر صعوبة. نتيجةً لذلك، كسب Astra أربع نقاط وقفز إلى المركز الثاني، بينما حافظ Fable 5.1 على الصدارة، وجاءت Meta في المركز الثالث. وفي سياق متصل، حذّر الباحثان في ستانفورد آنكا رُويل ومايك هاردي من أن بعض المختبرات تعيد تشغيل الاختبارات تحت شروط معدّلة، وهي ممارسة باتت تُعرف في القطاع باسم benchmaxxing.

فجوة التسعير بين نماذج الجيل المتقدم

تتسع اليوم فجوة الأسعار بين نماذج الذكاء المتقدمة أكثر من اتساع الفوارق في القدرات الخام، إذ تتباين تكلفة توكنات الإخراج في الإصدارات الرائدة هذا الشهر بفارق يصل إلى نحو 13 ضعفاً.

تسعّر Astra تكلفة الاستخدام عند 10 دولارات لكل مليون توكن إدخال، و50 دولاراً لكل مليون توكن إخراج، في مستوى مماثل لـ Fable 5.1، لكنه أعلى بحوالي 6.7 مرات من نموذج Grok 4.6 التابع لـ xAI، الذي يضعه أحد مؤشرات المقارنة في مرتبة أدنى بكثير من Astra في الأداء الإجمالي.

جاء إطلاق Astra ليختتم واحداً من أكثر الأسابيع ازدحاماً بالإصدارات في تاريخ الصناعة.

شركة Anthropic طرحت Fable 5.1 في الأول من سبتمبر، وتبعتها Meta وغوغل في اليوم التالي بإطلاق Muse Spark 1.3 وGemini 3.8 Flash على التوالي. أما أوبن إيه آي، فكانت قد أجّلت طرح Astra بعد حادثة في يوليو تسرب خلالها أحد نماذج GPT‑5.6 من «الصندوق الرملي» التجريبي وشن هجوماً على منصة Hugging Face، وهي واقعة دفعت الشركة إلى إعادة تصميم آليات ضبط قدرات الهجوم السيبراني في نماذجها.

اقرأ أيضاً: وكلاء أوبن إيه آي يسيطرون على ويكي ألماني ويجرون أكثر من 15 ألف تعديل

Alexey Bondarev profile photo

Alexey Bondarev

أليكسي بونداريف هو رئيس قسم المحتوى في Yellow.com، وقد قام بتغطية أخبار العملات المشفّرة خلال السنوات العشر الماضية. وهو متخصص في إعداد أبحاث معمّقة ومقالات تعليمية، مع تركيز على التقارير التحليلية، وسياق الصناعة، والقوى الكبرى التي تشكّل عالم العملات المشفّرة، ابتداءً من عصر الذكاء الاصطناعي وتقنيات الأمن وصولاً إلى الابتكار في التكنولوجيا المالية. يؤمن بأن كل ما هو رقمي سيتفوّق قريبًا على كل ما هو تماثلي، ويعمل بجد لجعل ذلك حقيقة.

إخلاء المسؤولية وتحذير المخاطر: المعلومات المقدمة في هذا المقال مخصصة للأغراض التعليمية والإعلامية فقط وتستند إلى رأي المؤلف. وهي لا تشكل مشورة مالية أو استثمارية أو قانونية أو ضريبية. أصول العملات المشفرة شديدة التقلب وتخضع لمخاطر عالية، بما في ذلك خطر فقدان كامل أو جزء كبير من استثمارك. قد لا يكون تداول أو حيازة الأصول المشفرة مناسباً لجميع المستثمرين. الآراء المعبر عنها في هذا المقال هي آراء المؤلف (المؤلفين) فقط ولا تمثل السياسة أو الموقف الرسمي لشركة Yellow أو مؤسسيها أو مديريها التنفيذيين. قم دائماً بإجراء بحثك الشامل بنفسك (D.Y.O.R.) واستشر مختصاً مالياً مرخصاً قبل اتخاذ أي قرار استثماري.
آخر الأخبار
عرض جميع الأخبار
أخبار ذات صلة
مقالات البحث ذات الصلة
مقالات التعلم ذات الصلة
«أسترا» من أوبن إيه آي تُعلن كأذكى نموذج GPT‑6… والمختبرون يختلفون | Yellow