انقسام آراء الخبراء حول نموذج «كلود أوبوس 5» بعد أولى الاختبارات المستقلة

انقسام آراء الخبراء حول نموذج «كلود أوبوس 5» بعد أولى الاختبارات المستقلة

منح مختبرات تقييم مستقلة نموذج Anthropic الجديد Claude Opus 5 درجة 159 على أحد مؤشرات القدرات، أي نقطتين فقط خلف Claude Fable 5، بينما انقسمت الآراء بشكل حاد حول أدائه في مراجعة الشيفرات البرمجية.

أبرز النقاط:

  • منصة Epoch AI قيّمت «كلود أوبوس 5» عند 159 نقطة على مؤشر القدرات مقابل 161 نقطة لـ«كلود فايبل 5»، مع تعادل النموذجين في أداء هندسة البرمجيات.
  • أظهرت اختبارات CodeRabbit دقة 39.3% في التعليقات القابلة للتنفيذ على مراجعات الشيفرة، ارتفاعاً من خط أساس بلغ 35.2%، لكنها سجّلت في المقابل أربعة أضعاف عدد الملاحظات التفصيلية الصغيرة (Nitpicks).
  • فرق مؤسسية لدى Cognition وZapier رصدت تحسناً في قدرات تصحيح الأخطاء والأتمتة الشاملة لعمليات الأعمال.

معايير «كلود أوبوس 5» تحت مجهر التمحيص المبكر

أطلقت Anthropic النموذج يوم الجمعة، وقالت في بيانها إن النموذج يقترب من ذكاء «فايبل 5» المتقدّم بنصف السعر تقريباً، ما يضعه في خانة أداة يومية عامة الاستخدام وليست متخصصة فقط. معظم مقيمي النماذج من الأطراف الثالثة وافقوا على الصورة العامة، لكنهم اختلفوا على حجم الفارق.

Epoch AI منحت «أوبوس 5» درجة 159 على مؤشر القدرات مقابل 161 لـ«فايبل 5»، واعتبرت أن أداء النموذجين متعادل في هندسة البرمجيات، بحسب مراجعة شاملة نشرتها Latent Space أظهرت هذه المقارنات.

منصة Artificial Analysis وضعت النموذج في المركز الأول على مقياس «العمل المعرفي القائم على الوكلاء» (agentic knowledge work)، متقدماً على «فايبل 5» بنحو 150 نقطة Elo تقريباً، مع خفض تكلفة المهمة الواحدة بنسبة 20%.

لكن بعض المطورين انتقدوا مؤشر القدرات نفسه، معتبرين أن تحسناً بنقطة واحدة فقط فوق «أوبوس 4.8» لا يعكس فعلياً القفزة التي يلمسونها في الاستخدام اليومي. أحد المقيمين وجد أن إعداد «الجهد المتوسط» أعطى نتائج أفضل من الإعدادات الأعلى في اختبار برمجي.

اقرأ أيضاً: BitMEX Is Shutting Down After 11 Years With No Buyer In Sight

أحكام متباينة على أداء مراجعة الشيفرة

منصة CodeRabbit اختبرت «أوبوس 5» على نحو 100 نمط من الأخطاء المقتبسة من طلبات سحب (Pull Requests) حقيقية مفتوحة المصدر، بثلاث محاولات لكل إعداد، وسجّلت دقة بلغت 39.3% في التعليقات القابلة للتنفيذ.

هذه النتيجة تفوقت على خط الأساس البالغ 35.2% الذي يحققه نظام المراجعة المستخدم حالياً في الإنتاج، إلا أن النموذج رصد عدداً أقل من العلل المعروفة، وفي المقابل ولّد أربعة أضعاف عدد الملاحظات البسيطة منخفضة القيمة التي يضطر المهندسون إلى فرزها يدوياً.

عند مستوى الجهد الافتراضي، تراجعت الدقة إلى 26.4%. واستنتجت الشركة أن على الفرق التقنية التعامل مع «أوبوس 5» كمراجع ثانٍ يركّز على الدقة، وليس كترقية مباشرة لسير عمل مراجعة قائم ويعمل بصورة مستقرة.

كلير فو (Claire Vo)، التي تدير منظومة تقييم تضم سبعة نماذج موجهة لفرق المنتجات، وصفت النموذج بأنه «لامع لكن مزعج»، مشيرة إلى «نزعة عصابية» في سلوكه، وحالة تعارض دمج (Merge Conflict) رفض التعامل معها تماماً.

عملاء Anthropic يرصدون تحسناً في أداء الوكلاء البرمجيين

سكوت وو (Scott Wu)، الرئيس التنفيذي لشركة Cognition، قال إن «أوبوس 5» يقترب من أداء «فايبل» داخل وكيل البرمجة Devin، وبنصف التكلفة تقريباً، مع قوة خاصة في تصحيح الأخطاء وتحليل الأسباب الجذرية للأعطال.

ويد فوستر (Wade Foster)، الرئيس التنفيذي لـ Zapier، أوضح أن النموذج تصدّر لوائح الأداء في منصّة الأتمتة لدى الشركة، من دون استهلاك رموز (Tokens) أكثر من إصدارات Claude السابقة التي تحمل سعراً مماثلاً يبلغ 5 دولارات لكل مليون رمز إدخال.

لكن الثناء جاء مصحوباً بتحفّظات. فقد أشارت Anthropic إلى أن «أوبوس 5» يتراجع خلف نموذجها Mythos 5 في مهام الهجوم السيبراني الهجومي، وأن الطلبات التي تلتقطها مصنّفات الأمان في الشركة يجري تحويلها تلقائياً إلى نموذج «أوبوس 4.8».

هذه المقاربة الحذرة تأتي بعد فترة مضطربة لفئة النماذج الأعلى، إذ إن «فايبل 5» أُطلق في يونيو، ثم سحب من الخدمة بعد أيام قليلة، قبل أن يعود للمستخدمين مطلع يوليو.

المقال التالي: HubSpot Fell 12.7% And Analysts Point Straight At OpenAI's New Agent

إخلاء المسؤولية وتحذير المخاطر: المعلومات المقدمة في هذا المقال مخصصة للأغراض التعليمية والإعلامية فقط وتستند إلى رأي المؤلف. وهي لا تشكل مشورة مالية أو استثمارية أو قانونية أو ضريبية. أصول العملات المشفرة شديدة التقلب وتخضع لمخاطر عالية، بما في ذلك خطر فقدان كامل أو جزء كبير من استثمارك. قد لا يكون تداول أو حيازة الأصول المشفرة مناسباً لجميع المستثمرين. الآراء المعبر عنها في هذا المقال هي آراء المؤلف (المؤلفين) فقط ولا تمثل السياسة أو الموقف الرسمي لشركة Yellow أو مؤسسيها أو مديريها التنفيذيين. قم دائماً بإجراء بحثك الشامل بنفسك (D.Y.O.R.) واستشر مختصاً مالياً مرخصاً قبل اتخاذ أي قرار استثماري.
أخبار ذات صلة
مقالات البحث ذات الصلة
مقالات التعلم ذات الصلة
انقسام آراء الخبراء حول نموذج «كلود أوبوس 5» بعد أولى الاختبارات المستقلة | Yellow