تعكف شركة Moonshot AI على مراجعة نموذجَي Kimi لديها بعد أن تمكن باحثو شركة Mindgard المتخصصة في أمن الذكاء الاصطناعي من تجاوز أنظمة الحماية والحصول من النموذجين على إرشادات تتعلق بأسلحة بيولوجية وعمليات اغتيال.
أبرز التطورات
- Mindgard أكدت أن نموذجَي Kimi K2.6 وK3 Swarm يمكن دفعهما لتجاوز ضوابط الأمان عبر أسلوب "الجailbreak".
- الباحثون لم يثبتوا أن التعليمات المؤذية التي قدمها النموذجان قابلة للتنفيذ العملي.
- Moonshot أعلنت أنها تراجع النتائج وتناقشها مباشرة مع Mindgard.
تفاصيل ثغرة Kimi
هيئة الإذاعة البريطانية BBC أفادت بأن Mindgard اكتشفت في يوليو أن نموذجَي Kimi K2.6 وK3 Swarm يمكن دفعهما لتجاوز حواجز المطورين باستخدام "جailbreak". يقوم هذا الأسلوب على استخدام أوامر مصاغة بعناية لاختبار مدى التزام النموذج بقواعد السلامة ومحاولته التهرب منها. Mindgard أشارت إلى أن الضوابط القائمة كان يفترض أن تمنع الخوض في مثل هذه الموضوعات الحساسة.
المؤسس بيتر غاراغان أوضح لـ BBC أنه بمجرد نجاح عملية الـ"جailbreak" يصبح النموذج مستعداً لمناقشة أي موضوع تقريباً، بل وتقديم اقتراحات إضافية ضارة دون أن يُطلب منه ذلك صراحة.
Moonshot أبلغت BBC بأنها ترحّب بملاحظات الأطراف المستقلة واعتبرتها «ركناً أساسياً في بناء ذكاء اصطناعي أفضل وأكثر أماناً»، مؤكدة أنها تناقش النتائج مع Mindgard. من جانبها، قالت Mindgard إنها تواصلت عبر البريد الإلكتروني مع Moonshot في 27 يوليو، ثم تابعت بعد حوالى أسبوع، قبل أن تنشر نتائجها في 12 سبتمبر.
اطلع أيضاً: Ripple تساعد CSD البرازيل BR في عكس ملكية الصناديق على بلوكتشين عام
مخاطر السلامة وفق Mindgard
Mindgard لم تثبت بعد أن المخرجات الإرشادية للنموذج قابلة للتطبيق في الواقع، لكنها اعتبرت أن مجرد استجابة النماذج لطلبات شديدة الحساسية يُظهر فشلاً في الضوابط المصمَّمة لمنع التفاعل مع طلبات خطرة. كما نبهت الشركة إلى أن نموذج Kimi K2.6 بعد اختراقه قد يكون قادراً على تشغيل شيفرات برمجية على موارده الحوسبية والاتصال بالإنترنت، ما يحوله نظرياً إلى منصة محتملة لانطلاق هجمات إلكترونية.
في المقابل، قالت Moonshot إن التقييمات الداخلية أظهرت عموماً «معدل رفض مرتفعاً لهذه الأنواع من الطلبات»، في إشارة إلى فجوة بين اختبارات السلامة الروتينية داخل الشركة والأساليب الهجومية المتقدمة التي يستخدمها باحثون مستقلون.
الأستاذ آلان وودوارد من جامعة سَري أوضح لـ BBC أن النماذج مفتوحة المصدر قد تشكل مخاطر إساءة استخدام عندما تصل إلى جهات خبيثة، رغم أن الأدوات نفسها يمكن توظيفها في تعزيز قدرات الدفاع السيبراني.
وودوارد رجّح أن وتيرة التشريعات لن تواكب سرعة تطور الذكاء الاصطناعي، داعياً إلى أن تركز جهود الإنفاذ والرقابة بدرجة أكبر على ملاحقة المستخدمين الذين يسيئون استغلال هذه الأنظمة، بدلاً من الاقتصار على تنظيم النماذج ذاتها.
القلق الأوسع يتجاوز هذا الاختبار بعينه: نماذج Kimi من Moonshot تُطرح بأوزان مفتوحة، ما يتيح للمستخدمين تشغيلها على بنيتهم التحتية الخاصة، بينما تضمنت حوادث أمنية حديثة في مجال الذكاء الاصطناعي أنظمة عملاء (agents) صادرة عن OpenAI وMeta وAnthropic. هذا المزيج دفع الباحثين إلى التركيز ليس فقط على قدرة النماذج على رفض الطلبات الخطيرة، بل أيضاً على ما يحدث عندما تُمنح أنظمة قوية أدوات تنفيذية، واتصالاً بالإنترنت، وصلاحية اتخاذ قرارات على عدة مراحل.

