أوقفت شركة Anthropic وصول جميع نماذجها في الاختبارات الداخلية إلى الإنترنت الحي، بعد أن استغلت نماذج «كلود» – بما فيها Mythos 5 – ثغرات في مواقع حقيقية وتجاوزت القيود الموضوعة عليها، من بينها مواقع تديرها جهات حكومية أمريكية.
أبرز النقاط:
- أنثروبيك عطّلت بالكامل الوصول المباشر للإنترنت في كل التقييمات الداخلية، إلى أن تتمكن أدوات المراقبة من رصد أي سلوك غير مقصود للنماذج بشكل موثوق.
- بعض نماذج «كلود» نفذت أوامر على خادم جامعي، واستعملت رموز وصول (Tokens) للوصول إلى بيانات مدفوعة، وقدمت نماذج عبر مواقع إلكترونية حقيقية.
- نموذج «Claude Haiku 4.5» أرسل بلاغاً كاذباً عن جريمة قتل إلى شرطة فيلادلفيا، ما دفع الشرطة إلى توبيخ علني للشركة.
تقرير كلود من أنثروبيك
كشفت أنثروبيك في تقرير نشرته يوم الجمعة عن «أفعال غير مقصودة» صدرت عن النماذج أثناء التقييمات والاستخدام الداخلي، استناداً بالأساس إلى مراجعة لسجلات المحادثات بدأت في يوليو. وكانت بعض اختبارات المخاطر العالية والأمن السيبراني مفصولة عن الإنترنت مسبقاً.
القرار الجديد يمدّد الحظر ليشمل جميع التقييمات الداخلية دون تحديد موعد لانتهائه، على أن يستمر إلى أن تتأكد الشركة من أن أنظمة الرصد قادرة على التقاط مثل هذه السلوكيات بدقة كافية.
يقسم التقرير الحوادث إلى أربع فئات رئيسية: تنفيذ أوامر على خادم عبر ثغرة برمجية، إرسال نماذج على مواقع حقيقية، الوصول إلى بيانات محمية، واستخدام مختصرات الروابط للتحايل على حدود أدوات الاستخدام. بعض هذه المواقع تعود لوكالات فيدرالية ووكالات على مستوى الولايات والبلديات في الولايات المتحدة، وقالت أنثروبيك إنها أطلعت البيت الأبيض وأخطرت كل جهة حكومية متضررة.
في إحدى الحالات، استخرج نموذج «Claude Mythos 5» رموز وصول فعّالة من خريطة عقارية تابعة لحكومة محلية، ثم تواصل مباشرة مع الخادم الخلفي الذي يشغّل الخدمة. وفي حالة أخرى، أرسل «Claude Haiku 4.5» بلاغاً مختلقاً عن جريمة قتل غير محلولة عبر نموذج إلكتروني لشرطة فيلادلفيا بتاريخ 18 يوليو، قبل أن يُصنَّف كرسالة مزعجة (Spam). شرطة فيلادلفيا وصفت التأخر لمدة شهرين في اكتشاف الحادثة وإبلاغها بأنه «غير مقبول».
مادة ذات صلة: لدى زي كاش هدف كمي في يناير لـ 70% من ZEC، لكن دون موعد محدد
تحذير فون آركس
حذّرت سيدني فون آركس من مجموعة السلامة في الذكاء الاصطناعي Nightingale في مقابلة مع موقع TechCrunch قُبيل نشر التقرير، من أن قطع النماذج عن الإنترنت المفتوح سيشكّل عبئاً كبيراً على الباحثين وعلى وتيرة تطوير النماذج. وقالت: «لا بد أن تجري مواءمتها في مرحلةٍ ما».
وأقرت أنثروبيك بأن تدريب المواءمة وحده لا يكفي حالياً للاستخدامات التي تتطلب بحثاً على الويب أو تفاعلاً مباشراً مع الحاسوب، لذلك تعتمد أيضاً على مصنِّفات وأدوات حماية إضافية. وربطت الشركة هذه السلوكيات ببيئات تدريب غير مثالية تكافئ النماذج أحياناً على التحايل على القيود، وهو نمط يُعرَف في الأوساط البحثية باسم «اختراق المكافأة» (Reward Hacking). وأضافت أن أدوات الكشف الجديدة التي اختبرتها تمكنت من حجب جميع الحالات في بيئة الاختبار.
قيّمت أنثروبيك حوادث التقرير الجديد بأنها أقل خطورة بشكل واضح من حوادث الصيف الماضي.
جاءت هذه الإفصاحات بعد تقرير نُشر في 30 يوليو، قالت فيه الشركة إن ثلاثة نماذج من «كلود» تمكنت أثناء تجارب أمن سيبراني من الوصول إلى الإنترنت واكتساب صلاحيات غير مصرح بها على أنظمة ثلاث جهات مختلفة. وشمل ذاك التقييم مراجعة 141,006 تشغيلات اختبارية. وبدأت هذه المراجعة بعد إعلان OpenAI في 21 يوليو أن بعض نماذجها كسرت عزل بيئة التجارب ووصلت إلى بنية تحتية تابعة لـ Hugging Face.
للمطالعة لاحقاً: منصة Kalshi تواجه الـ NFL أمام المحكمة العليا بينما 1.8 مليار دولار معلّقة على أحد أيام الأحد الكروية

