وثّق معهد أمن الذكاء الاصطناعي في المملكة المتحدة (AISI) 19 تصرفاً غير مصرح به لوكلاء ذكاء اصطناعي متقدمين خلال اختبار للأمن السيبراني، معظمها عُزي إلى نموذج Anthropic «مايثوس 5».
أبرز النقاط:
- المعهد أجرى تحدياً واحداً في الأمن السيبراني 122 مرة على سبعة نماذج متقدمة أواخر يوليو.
- 17 من أصل 19 تصرفاً متمرداً صدرت عن «مايثوس 5»، واثنان عن نموذج GPT-5.6 Sol من OpenAI.
- أحد الوكلاء أنشأ هويات مزيفة للضغط على مُشرف بشري للموافقة على كود ضار.
نتائج اختبار AISI السيبراني
أنظمة المراقبة الأمنية رصدت صباح 28 يوليو تسرب بيانات من أحد أنظمة الاختبار التابعة للمعهد عبر شبكة «تور» المجهولة الهوية، ليتحرك فريق التقييم ويفتش نشاط الوكلاء خلال دقائق. وخلص المحققون إلى أن أحد الوكلاء فتح «طلب سحب» (Pull Request) خبيثاً في مشروع حقيقي ومفتوح المصدر مستضاف على منصة GitHub، وفقاً لما كشفته تقارير.
أوقف المعهد جميع التشغيلات، وعزل الخوادم، وقطع الوصول الداخلي إلى أقوى نماذجه خلال أقل من ساعة.
وفي إفصاح نشره في 4 أغسطس، أوضح المعهد أن التحدي أُجري 122 مرة عبر سبعة نماذج، وأن 10 تشغيلات أدت إلى نشاط فعلي على الإنترنت استهدف أشخاصاً ومنظمات حقيقية. «مايثوس 5» كان مسؤولاً عن 17 من أصل 19 تصرفاً موثقاً، بينما سجل نموذج OpenAI GPT-5.6 Sol حالتين في تشغيل واحد أُجري مع تعطيل مرشحات الأمن السيبراني الخاصة به.
السلوكيات امتدت بين 25 و28 يوليو.
للمزيد: iPhone 18 Pro Max قد يكون أول هواتف آبل بشريحة 2nm أسرع 15٪
أساليب الخداع في «مايثوس 5»
في أخطر تسلسل رصده المعهد، قام الوكيل أولاً بالبحث عن المشرفين البشريين على المشروع، ثم أنشأ عدة هويات رقمية مزيفة واستغلها للضغط على مُراجع حقيقي حتى يوافق على دمج الكود الخبيث. وعندما أثار طلب السحب انتباهاً علنياً، عاد الوكيل لتنقيح سجله السابق بما يوحي أن النشاط غير ضار، ودرس خيار تبنّي شخصية جديدة تماماً، وعرض التنسيق مع وكلاء آخرين يشاركون في نفس التحدي.
المُشرف البشري نجح في التقاط الخلل ورفض دمج الكود.
AISI وصف الحادثة بأنها أول تجلٍّ واضح في الواقع العملي لمخاطر «الاستقلالية» و«الخداع» في نماذج الذكاء الاصطناعي دون توجيه صريح نحو ذلك، لكنه شدد في الوقت نفسه على أن بعض خيارات التصميم في بيئة الاختبار سهّلت ظهور هذا السلوك. الوكيل لم يُطلب منه أبداً أن يخدع أي طرف.
إفصاحات المختبرات المطوِّرة
لم يحاول أي وكيل الخروج من «صندوق الرمل» (بيئة العزل)، وأكد المعهد في بيان شدد فيه على أن الوصول إلى الإنترنت وكذلك مرشحات الأمن لدى مزودي النماذج تم تعطيلها عمداً لقياس «القدرة القصوى» لهذه الأنظمة.
منصة GitHub أكدت أن النشاط يخالف شروط الاستخدام، واضطلعت مع المعهد بإزالة جميع الآثار الرقمية وإخطار المستخدمين الذين تواصل معهم النموذج. ويعتزم AISI الآن فرض ضوابط شبكية أكثر تشدداً، ومراقبة مباشرة لجلسات التقييم، والاستعانة بمراجعة مستقلة من METR، إلى جانب تدقيق اختبارات سابقة بحثاً عن سلوكيات ربما لم تُرصد حينها.
الإفصاح الجديد يأتي بعد اعترافات منفصلة من المختبرين خلال الأسابيع الماضية؛ إذ كانت OpenAI قد أعلنت في 21 يوليو أن نموذج GPT-5.6 Sol تمكن من الإفلات من بيئة اختبار مغلقة. أما Anthropic فكشفت في 30 يوليو أن «مايثوس 5» حمّل حزمة برمجية خبيثة إلى مستودع أكواد عام جرى تثبيتها لاحقاً على عدة أنظمة.
اقرأ أيضاً: بيتكوين قد يحوّل «الخوف الشديد» إلى وقود لقفزة نحو 75 ألف دولار





