أطلقت شركة أنثروبيك يوم الاثنين نموذج Claude Sonnet 5.5، مؤكدة أن نموذج الذكاء الاصطناعي متوسط الفئة الجديد يعمل بسرعة تزيد عن 30% مقارنة بسلفه، مع خفض تكلفة كل مهمة بما يصل إلى 30%.
أبرز النقاط:
- Sonnet 5.5 حقق نتيجة 70.6% في اختبار البرمجة Terminal-Bench 4.0، مقابل 10.3% فقط لـ Sonnet 5.
- أول نموذج من فئة Sonnet يُطرح مع حزمة ضوابط سيبرانية كانت مخصصة سابقاً لأقوى أنظمة أنثروبيك.
- أحد الاختبارات المستقلة أشار إلى أنه قد يكون أعلى تكلفة لكل مهمة من Sonnet 5 عند تشغيله بأقصى طاقة.
نتائج أداء Claude Sonnet 5.5
يُعد Sonnet 5.5 ثاني نماذج عائلة Claude 5.5، وجاء بعد ستة أيام فقط من إطلاق النموذج الرائد Claude Opus 5.5، بحسب ما ذكرته الشركة في بيان الإطلاق على موقعها الرسمي هنا.
وروّجت أنثروبيك للنموذج الجديد باعتباره مكمّلاً أسرع وأقل تكلفة من Opus 5.5، وموجهاً للمهام اليومية الواضحة المعالم، وإصلاح الأخطاء البرمجية، وإعداد الوثائق المصقولة والعروض التقديمية وجداول البيانات. تسعير الاستخدام محدد عند 2 دولار لكل مليون رمز إدخال، و10 دولارات لكل مليون رمز مخرجات.
في اختبار Terminal-Bench 4.0، وهو اختبار «برمجة بالوكيل» يعتمد على تنفيذ مهام متعددة، سجّل Sonnet 5.5 نتيجة بلغت 70.6%، مقارنةً بـ 10.3% لـ Sonnet 5 و66.4% لـ Opus 5.5 الأعلى سعراً. كما أصبح أول نموذج من عائلة Sonnet ينجح في اجتياز لعبة Pokémon Red بالاعتماد على لقطات الشاشة فقط، في اختبار لقدراته على العمل طويل الأمد وفهم الصور.
النموذج متاح حالياً عبر جميع منصات أنثروبيك، بما في ذلك Amazon Web Services وGoogle Cloud وMicrosoft Azure وفقاً لما أعلنته الشركة. وأشارت أنثروبيك إلى أن نموذج Claude Haiku 5.5 الأصغر حجماً، الموجه لحالات الاستخدام كثيفة المعاملات والحساسة للتكلفة، سيُطرح خلال الأسابيع المقبلة، ما يكمل سلسلة النماذج الثلاثية.
موصى بالقراءة أيضاً: أوبن إيه آي توقف اندفاعها في مجال Frontier AI بعد «هروب» النموذج من بيئة Sandbox في 20 سبتمبر
ضوابط Sonnet 5.5 السيبرانية وتكلفته
استشهدت أنثروبيك في بيانها التنفيذي بما قاله دانيال فوغل، المدير التشغيلي في Epic Games، حيث أوضح أن النموذج تعامل في الاختبارات الأولية مع «عشرات الآلاف من أسطر شيفرات أنظمة اللعب». وأضاف أن النموذج «اجتاز مستوى الجودة نفسه المتوقع عادةً من نماذج الفئة الأعلى».
وبما أن قدراته السيبرانية تقارب قدرات Opus 5، يُعد Sonnet 5.5 أول نموذج من فئة Sonnet يُطرح مزوداً بمجموعة ضوابط سيبرانية كانت أنثروبيك تحتفظ بها سابقاً لأكثر نماذجها تقدماً. إصلاح الأعطال البرمجية الروتينية يظل من دون تأثير يذكر، لكن طلبات الأمن السيبراني الأعلى خطورة تُحوَّل بشكل واضح إلى Sonnet 5. كما أدخلت الشركة مصنِّفات جديدة لمنع محاولات استرجاع «آلية الاستدلال» الخاصة بالنموذج.
مع ذلك، لا تتفق جميع الاختبارات مع ادعاءات خفض التكلفة. شركة Artificial Analysis قاست تكلفة مرجّحة قدرها 7.60 دولارات لكل مهمة اختبار عند تشغيل النموذج بأقصى طاقة، مقابل 5.09 دولارات لـ Sonnet 5، رغم ارتفاع مؤشر أداء النموذج الجديد من 38 إلى 56.
يأتي الإطلاق بعد طرح Opus 5.5 في 22 سبتمبر، حين خفضت أنثروبيك سعر النموذج الرائد بنسبة 20% إلى 4 دولارات لكل مليون رمز إدخال و20 دولاراً لكل مليون رمز مخرجات. وقالت الشركة آنذاك إن Opus 5.5 سيخفض التكلفة بنحو 40% مقارنةً بـ Opus 5 في أعباء العمل الاعتيادية، مع تسريع زمن توليد المخرجات بأكثر من 30%. في اليوم نفسه، أطلقت OpenAI نموذجي GPT-6 Sol وGPT-6 Luna بسعر يعادل نصف تكلفة النماذج السابقة.
للمتابعة: بلاك روك تتوقع دخول قوة الحوسبة إلى أسواق العقود الآجلة

