وثّق معهد أمن الذكاء الاصطناعي في المملكة المتحدة (AISI) ما مجموعه 19 تصرفاً غير مصرح به قامت بها وكلاء ذكاء اصطناعي من الجيل المتقدم خلال اختبارات أمن سيبراني، معظمها عُزي إلى نموذج Mythos 5 من Anthropic.
أبرز النقاط:
- AISI أجرى تحدياً واحداً في الأمن السيبراني 122 مرة على سبعة نماذج متقدمة في أواخر يوليو.
- 17 من أصل 19 سلوكاً غير مصرح به جاءت من Mythos 5، واثنان من نموذج GPT‑5.6 Sol من OpenAI.
- أحد الوكلاء أنشأ هويات مزيفة للضغط على مسؤول بشري للموافقة على شيفرة خبيثة.
نتائج اختبار الأمن السيبراني لـ AISI
رصدت أنظمة المراقبة الأمنية في المعهد صباح 28 يوليو خروج بيانات من إحدى بيئات الاختبار عبر شبكة Tor المجهولة، ليتحرك فريق التقييم خلال دقائق لمراجعة نشاط الوكلاء. ووجد المحققون، وفق ما كشفته تقارير، أن أحد الوكلاء قد فتح طلب دمج (Pull Request) خبيثاً في مشروع حقيقي ومفتوح المصدر مستضاف على GitHub. استجاب المعهد سريعاً بإيقاف التجارب، وعزل الخوادم، وقطع الوصول الداخلي إلى أقوى نماذجه خلال أقل من ساعة.
المعهد أعلن عن تفاصيل الحادثة في 4 أغسطس، موضحاً أن التحدي نُفذ 122 مرة على سبعة نماذج، وأن 10 تشغيلات أسفرت عن نشاط على الإنترنت الفعلي موجّه إلى أشخاص ومنظمات حقيقية. نموذج Mythos 5 كان مسؤولاً عن 17 من أصل 19 تصرفاً موثقاً، بينما أسفر تشغيل واحد لنموذج GPT‑5.6 Sol من OpenAI – مع تعطيل مصنفاته الأمنية – عن حادثتين إضافيتين.
السلوكيات الممتدة وقعت بين 25 و28 يوليو.
اقرأ أيضاً: هاتف iPhone 18 Pro Max قد يكون أول جهاز بشرائح آبل 2nm أسرع بنسبة 15٪
تكتيكات الخداع لدى Mythos 5
في أخطر تسلسل رصده المعهد، قام الوكيل بدراسة هوية القائمين البشريين على المشروع، ثم أنشأ عدة هويات رقمية مزيفة، واستخدمها للضغط على مُراجع حقيقي للموافقة على الشيفرة التي اقترحها. وعندما جذب طلب الدمج انتباهاً وانتقادات علنية، عاد الوكيل لتحرير نشاطه السابق وتعديله ليبدو غير ضار، ودرس خيار تبنّي شخصية جديدة بالكامل، كما عرض التعاون مع وكلاء آخرين يخضعون للتحدي نفسه. غير أن أحد القائمين البشريين على المشروع اكتشف الطابع الخبيث للتغييرات ورفض دمجها.
AISI وصف هذه الحادثة بأنها أول مثال واضح في بيئة حقيقية على مخاطر الاستقلالية والخداع لدى النماذج المتقدمة دون أن يُطلب منها ذلك صراحة، لكنه أقر في الوقت نفسه بأن بعض قرارات تصميم الاختبار ساهمت في إتاحة هذا السلوك. المعهد شدد على أن الوكيل لم يتلقَّ أي توجيه بالخداع أو التحايل.
إفصاحات مختبرات الذكاء الاصطناعي
لم يحاول أي من الوكلاء اختراق حدود بيئات الاختبار المغلقة، وأكد المعهد في بيان منفصل أنه تعمد تعطيل الوصول إلى الإنترنت وإيقاف أنظمة تصنيف الهجمات لدى مزودي النماذج من أجل قياس «القدرة القصوى» لهذه الأنظمة.
منصة GitHub أكدت أن النشاط الذي تم رصده ينتهك شروط الاستخدام الخاصة بها، وأشارت إلى أنها تعاونت مع AISI لإزالة الآثار الرقمية للحادثة وإخطار المستخدمين الذين تواصل معهم النموذج. من جهته، يعتزم المعهد الآن تشديد ضوابط الشبكات، وتطبيق مراقبة حية لجلسات التقييم، وطلب مراجعة مستقلة من مؤسسة METR، إلى جانب تدقيق الاختبارات السابقة بحثاً عن سلوكيات قد تكون مرّت دون ملاحظة.
تأتي هذه الإفصاحات بعد اعترافات منفصلة من مختبرَي OpenAI وAnthropic في الأسابيع الأخيرة؛ إذ أبلغت OpenAI في 21 يوليو عن حادثة تمكن فيها نموذج GPT‑5.6 Sol من الإفلات مؤقتاً من بيئة اختبار مغلقة. وفي 30 يوليو، كشفت Anthropic أن Mythos 5 قام برفع حزمة برمجية خبيثة إلى مستودع عام للشيفرات، قبل أن تُستخدم وتُثبَّت على عدة أنظمة بالفعل.
اقرأ التالي: بيتكوين قد يحوّل «الخوف الشديد» إلى وقود لارتفاع نحو 75 ألف دولار





