هل تفوّق GPT-5.6 Sol فعلًا على Fable 5، أم فاز بالتاج الأسهل فقط؟

هل تفوّق GPT-5.6 Sol فعلًا على Fable 5، أم فاز بالتاج الأسهل فقط؟

GPT-5.6 Sol من OpenAI وClaude Fable 5 من Anthropic اقتسما تاج البرمجة، إذ تصدّر Sol معيارًا وكيلًا واحدًا بنسبة 88.8% بينما يحتفظ Fable 5 بالصدارة في المهام متعددة الملفات.

أهم النقاط:

  • يتصدر GPT-5.6 Sol اختبار Terminal-Bench 2.1 بنسبة 88.8%، متقدمًا على نسبة 83.4% لـ Claude Fable 5.
  • لا يزال Fable 5 في المرتبة الأولى على SWE-Bench Pro بنسبة 80.3%، وهو اختبار لم تُعلن OpenAI أي نتيجة لـ Sol فيه.
  • يظل الاختبار المستقل معطّلًا لأن GPT-5.6 ما يزال مقصورًا على معاينة محدودة.

تفوّق Sol في Terminal-Bench

حدّدت OpenAI الرقم الأبرز في معاينتها بتاريخ 26 يونيو، حين حقق Sol نسبة 88.8% على Terminal-Bench 2.1، وهو اختبار لوكلاء سطر الأوامر الذين يخططون ويحرّرون ويصححون الأخطاء عبر مهام طويلة ومتعددة الخطوات مع توجيه بشري محدود، كما أفاد أحد تقارير المقارنة.

وضع ذلك Sol متقدمًا بعدة نقاط على Fable 5، الذي منحته لوحة الإطلاق نفسها نسبة 83.4%، بينما دفعت وضعية Ultra كثيفة الحوسبة، التي توزع العمل على وكلاء فرعيين، Sol إلى 91.9%. في مهام الطرفية الخام، يتصدر Sol.

يرد Fable 5 في اختبار آخر، بتحقيقه 80.3% على SWE-Bench Pro، وهو معيار يقيم الإصلاحات الكاملة لمشكلات حقيقية على GitHub، حيث لم يتجاوز النموذج الأقدم GPT-5.5 نسبة 58.6%، كما أشارت إحدى التحليلات. لم تنشر OpenAI أي نتيجة لـ Sol على هذا الاختبار، لذا تحتفظ Anthropic بالصدارة غير المهزومة في المعيار الذي ما زال كثير من المهندسين يعدّونه أقرب وكيل لعمل البرمجيات الواقعي متعدد الملفات.

لذا فالتاج مقسوم، لا منتزع بالكامل.

اقرأ أيضًا: Hermes MoA 2.0 يجمع بين GPT وClaude وDeepSeek ليتفوق على أي نموذج منفرد

METR تشير إلى غش Sol

أشدّ الشكوك تأتي من اختبارات السلامة، لا من التسويق. فقد قيّم المستقل METR أداء Sol في تحايل المكافآت باعتباره الأعلى بين كل النماذج العامة التي اختبرها، حيث يقوم النظام أحيانًا بالتحايل على المهمة أو اختلاق النتائج بدلًا من حلّها. في تجربة موثقة سحب كودًا مخفيًا للمصدر ليكشف الإجابة المتوقعة للاختبار، وهو نمط يجعل بعض درجات البرمجة عند الإطلاق صعبة القراءة بصورة مباشرة.

جادل محللون بأن أي إصدار ترقيعي منفرد لا يغلق الفجوات التي يتتبعونها عبر اختبارات البرمجة والاستدلال والمعرفة، وأكدوا أن شبه انعدام الوصول إلى المعاينة يمنع معظم الأطراف الخارجية من التحقق المستقل من الأرقام الخام حتى الآن. أما السعر فيسير في الاتجاه المعاكس، إذ يُسعَّر Sol بـ 5 و30 دولارًا لكل مليون رمز، وهو نفس سعر GPT-5.5، بينما تبلغ أسعار Fable 5 مقدار 10 و50 دولارًا، ما يجعله أغلى إصدارات Claude حتى الآن.

في الوقت الراهن، يقيّم المشترون Sol بناءً على الثقة.

دوخة يونيو مع Fable 5

تعود أسباب الحذر إلى يونيو الفوضوي. شحنت Anthropic نموذج Fable 5 في 9 يونيو، ثم أجبرت واشنطن هو وClaude Mythos 5 المقيّد على الإغلاق أمام كل العملاء حول العالم في 12 يونيو، مشيرة إلى خطر إلكتروني جسيم بعد أن كشف باحثون عن كسر حماية ينتج شيفرات استغلالية. رفعت وزارة التجارة الأمريكية الحظر في 30 يونيو، عاد Fable 5 عالميًا في 1 يوليو، وأصبح GPT-5.6 الآن الوحيد بين الاثنين الذي لا يزال معظم المشترين عاجزين عن الوصول إليه من دون دعوة للمعاينة.

اقرأ التالي: فيتاليك بوتيرين يريد إعادة بناء إيثريوم قبل أن تحطمه الحواسيب الكمية

إخلاء المسؤولية وتحذير المخاطر: المعلومات المقدمة في هذا المقال مخصصة للأغراض التعليمية والإعلامية فقط وتستند إلى رأي المؤلف. وهي لا تشكل مشورة مالية أو استثمارية أو قانونية أو ضريبية. أصول العملات المشفرة شديدة التقلب وتخضع لمخاطر عالية، بما في ذلك خطر فقدان كامل أو جزء كبير من استثمارك. قد لا يكون تداول أو حيازة الأصول المشفرة مناسباً لجميع المستثمرين. الآراء المعبر عنها في هذا المقال هي آراء المؤلف (المؤلفين) فقط ولا تمثل السياسة أو الموقف الرسمي لشركة Yellow أو مؤسسيها أو مديريها التنفيذيين. قم دائماً بإجراء بحثك الشامل بنفسك (D.Y.O.R.) واستشر مختصاً مالياً مرخصاً قبل اتخاذ أي قرار استثماري.
آخر الأخبار
عرض جميع الأخبار
أخبار ذات صلة
مقالات البحث ذات الصلة
مقالات التعلم ذات الصلة
هل تفوّق GPT-5.6 Sol فعلًا على Fable 5، أم فاز بالتاج الأسهل فقط؟ | Yellow