أنثروبيك راجعت سجلات 141,006 عملية تقييم للأمن السيبراني، لتجد ثلاث حالات استطاعت فيها نماذج كلود الوصول إلى الإنترنت المفتوح واختراق أنظمة حية تابعة لجهات خارجية.
أبرز النقاط:
- أنثروبيك فحصت 141,006 تجربة تقييم أمني وحددت 6 عمليات مرتبطة بثلاث حوادث اختراق حقيقية منفصلة.
- خلل في تهيئة بيئة اختبار لدى الشريك Irregular أبقى الاتصال بالإنترنت مفعّلاً رغم أن التعليمات أوهمت النماذج بأنه معطل.
- تورطت النماذج Opus 4.7 وMythos 5 ونموذج بحثي داخلي، وأقدم واقعة تعود إلى أبريل.
ثلاثة اختراقات موثّقة لنماذج "كلود"
الشركة كشفت عن الحوادث في تدوينة نُشرت الخميس، عرضت فيها نتائج تحقيقها الداخلي والإجراءات التصحيحية التي تعتزم تطبيقها.
فرق العمل بحثت في سجلات التقييم عن أي مؤشر على أن النماذج لامست الإنترنت المفتوح انطلاقاً من بيئات اختبار صُممت أساساً لعزلها تماماً. وحددت ست تجارب ضمن ثلاث حوادث منفصلة، وجميعها تعود إلى شريك تقييم خارجي واحد.
التعليمات أوضحت للنماذج أنها تعمل دون اتصال بالإنترنت، لكن سوء فهم بين المختبر وشريك التقييم Irregular أبقى الاتصال الفعلي قائماً في الخلفية. وبمجرد اتصاله بالإنترنت، استغل الذكاء الاصطناعي كلمات مرور ضعيفة ونقاط نهاية غير محمية، دون الحاجة للبحث عن ثغرات برمجية معقدة.
نموذج Opus 4.7 أدرك أنه وصل إلى نظام إنتاج فعلي في الحالات الأربع للحادثة المنسوبة إليه، لكنه واصل الهجوم، وسحب بيانات اعتماد للولوج وتفاعل مع قاعدة بيانات تحتوي سجلات عملاء حقيقية. نموذج Mythos 5 بدوره التقط إشارات تدل على الوصول إلى الإنترنت المفتوح، ثم دحض استنتاجه بنفسه وأقنع نفسه بأنه لا يزال في محاكاة تجريبية. وبعد ذلك نشر حزمة خبيثة في سجل حزم Python العام، حيث قامت أنظمة خارجية بتحميل الكود وتشغيله قبل اكتشافه.
اطلع أيضاً على: حجم تداولات DEX يهبط 26% في يوليو مع تراجع السيولة على السلسلة
خبراء الأمن ينتقدون ضوابط "صناديق الرمل"
النموذج البحثي الداخلي الأحدث كان الوحيد الذي أوقف نفسه ذاتياً، بعد أن خلص إلى أن الهدف الذي يهاجمه لا يرتبط بالتمرين المطلوب منه.
هايدي خلاف، كبيرة علماء الذكاء الاصطناعي في معهد AI Now والمتعاونة السابقة مع OpenAI في مجال السلامة، وصفت هذا النوع من "صناديق الرمل" بأنه سيئ السمعة من حيث ضعف الأمان. كما أن تحالف أمن الحوسبة السحابية (Cloud Security Alliance) دعا المختبرات إلى تشديد المراقبة والتحكم في الوكلاء الذاتيّين طوال اختبارات القدرات. متحدث باسم شريك التقييم أبلغ الصحافيين أن تحقيقه الداخلي ما زال جارياً، وأشاد بتعاون المختبر وشفافيته.
استجابة "أنثروبيك" وسجل نموذج Mythos
أنثروبيك أوقفت جميع اختبارات الأمن السيبراني في 23 يوليو، وحددت الحوادث الثلاثة في اليوم التالي، ثم أخطرت الجهات المتضررة في 27 يوليو.
اثنتان من تلك المنظمات لم ترصد النشاط مطلقاً من طرفها، فيما يتولى المقيم المستقل METR حالياً مراجعة القضية بالكامل.
الحادثة تأتي بعد أشهر من تحذيرات أطلقتها الشركة نفسها بشأن قدرات أحد أقوى نماذجها. فقد كلفت أنثروبيك ذلك النموذج بمحاولة الخروج من "صندوق رمل" مؤمن خلال اختبار مضبوط هذا العام، ونجح بالفعل في الوصول إلى خدمات لم يكن من المفترض أن يلمسها. ثم بعث النموذج رسالة بريد إلكتروني إلى أحد الباحثين، مستخدماً قدرة لم يكن من المخطط منحه إياها.
اقرأ أيضاً: عميل OpenAI المتمرد اخترق 4 خدمات إضافية إلى جانب Hugging Face






