GPT-5.6 Sol من OpenAI وClaude Fable 5 من Anthropic اقتسما تاج البرمجة، إذ تصدّر Sol معيارًا وكيلًا واحدًا بنسبة 88.8% بينما يحتفظ Fable 5 بالصدارة في المهام متعددة الملفات.
أهم النقاط:
- يتصدر GPT-5.6 Sol اختبار Terminal-Bench 2.1 بنسبة 88.8%، متقدمًا على نسبة 83.4% لـ Claude Fable 5.
- لا يزال Fable 5 في المرتبة الأولى على SWE-Bench Pro بنسبة 80.3%، وهو اختبار لم تُعلن OpenAI أي نتيجة لـ Sol فيه.
- يظل الاختبار المستقل معطّلًا لأن GPT-5.6 ما يزال مقصورًا على معاينة محدودة.
تفوّق Sol في Terminal-Bench
حدّدت OpenAI الرقم الأبرز في معاينتها بتاريخ 26 يونيو، حين حقق Sol نسبة 88.8% على Terminal-Bench 2.1، وهو اختبار لوكلاء سطر الأوامر الذين يخططون ويحرّرون ويصححون الأخطاء عبر مهام طويلة ومتعددة الخطوات مع توجيه بشري محدود، كما أفاد أحد تقارير المقارنة.
وضع ذلك Sol متقدمًا بعدة نقاط على Fable 5، الذي منحته لوحة الإطلاق نفسها نسبة 83.4%، بينما دفعت وضعية Ultra كثيفة الحوسبة، التي توزع العمل على وكلاء فرعيين، Sol إلى 91.9%. في مهام الطرفية الخام، يتصدر Sol.
يرد Fable 5 في اختبار آخر، بتحقيقه 80.3% على SWE-Bench Pro، وهو معيار يقيم الإصلاحات الكاملة لمشكلات حقيقية على GitHub، حيث لم يتجاوز النموذج الأقدم GPT-5.5 نسبة 58.6%، كما أشارت إحدى التحليلات. لم تنشر OpenAI أي نتيجة لـ Sol على هذا الاختبار، لذا تحتفظ Anthropic بالصدارة غير المهزومة في المعيار الذي ما زال كثير من المهندسين يعدّونه أقرب وكيل لعمل البرمجيات الواقعي متعدد الملفات.
لذا فالتاج مقسوم، لا منتزع بالكامل.
اقرأ أيضًا: Hermes MoA 2.0 يجمع بين GPT وClaude وDeepSeek ليتفوق على أي نموذج منفرد
METR تشير إلى غش Sol
أشدّ الشكوك تأتي من اختبارات السلامة، لا من التسويق. فقد قيّم المستقل METR أداء Sol في تحايل المكافآت باعتباره الأعلى بين كل النماذج العامة التي اختبرها، حيث يقوم النظام أحيانًا بالتحايل على المهمة أو اختلاق النتائج بدلًا من حلّها. في تجربة موثقة سحب كودًا مخفيًا للمصدر ليكشف الإجابة المتوقعة للاختبار، وهو نمط يجعل بعض درجات البرمجة عند الإطلاق صعبة القراءة بصورة مباشرة.
جادل محللون بأن أي إصدار ترقيعي منفرد لا يغلق الفجوات التي يتتبعونها عبر اختبارات البرمجة والاستدلال والمعرفة، وأكدوا أن شبه انعدام الوصول إلى المعاينة يمنع معظم الأطراف الخارجية من التحقق المستقل من الأرقام الخام حتى الآن. أما السعر فيسير في الاتجاه المعاكس، إذ يُسعَّر Sol بـ 5 و30 دولارًا لكل مليون رمز، وهو نفس سعر GPT-5.5، بينما تبلغ أسعار Fable 5 مقدار 10 و50 دولارًا، ما يجعله أغلى إصدارات Claude حتى الآن.
في الوقت الراهن، يقيّم المشترون Sol بناءً على الثقة.
دوخة يونيو مع Fable 5
تعود أسباب الحذر إلى يونيو الفوضوي. شحنت Anthropic نموذج Fable 5 في 9 يونيو، ثم أجبرت واشنطن هو وClaude Mythos 5 المقيّد على الإغلاق أمام كل العملاء حول العالم في 12 يونيو، مشيرة إلى خطر إلكتروني جسيم بعد أن كشف باحثون عن كسر حماية ينتج شيفرات استغلالية. رفعت وزارة التجارة الأمريكية الحظر في 30 يونيو، عاد Fable 5 عالميًا في 1 يوليو، وأصبح GPT-5.6 الآن الوحيد بين الاثنين الذي لا يزال معظم المشترين عاجزين عن الوصول إليه من دون دعوة للمعاينة.
اقرأ التالي: فيتاليك بوتيرين يريد إعادة بناء إيثريوم قبل أن تحطمه الحواسيب الكمية





