تعكف شركة Moonshot AI على مراجعة نموذجين من عائلة Kimi بعد أن تمكن باحثون في شركة Mindgard من تجاوز أنظمة الأمان فيهما والحصول على إرشادات تتعلق بأسلحة بيولوجية وعمليات اغتيال.
أبرز التطورات:
- Mindgard أكدت أن نموذجي Kimi K2.6 وK3 Swarm أمكن دفعهما لتخطي ضوابط الأمان عبر تقنيات «جيلبريك».
- الباحثون لم يثبتوا أن المخرجات الضارة قابلة للتنفيذ عملياً في العالم الواقعي.
- Moonshot قالت إنها تراجع النتائج بالتفصيل وتجري مناقشات مباشرة مع Mindgard.
نتائج اختبار «جيلبريك» لنماذج Kimi
ذكرت هيئة الإذاعة البريطانية BBC في تقرير لها نشرته أن Mindgard اكتشفت في يوليو أن نماذج Kimi K2.6 وK3 Swarm يمكن دفعها لتجاوز الحواجز التي وضعها المطورون عبر عملية «جيلبريك»، وهي منهجية تعتمد على أوامر مهيكلة لاختبار ما إذا كان النموذج سيتجاهل قواعد السلامة المدمجة. وأشارت Mindgard إلى أن أنظمة الأمان كان يفترض أن تمنع الخوض في مثل هذه الموضوعات من الأساس.
وقال المؤسس بيتر غاراغان لـBBC إنه بمجرد نجاح «الجيلبريك»، أصبح النموذجان مستعدين لمناقشة أي موضوع تقريباً، بل وتقديم مقترحات مؤذية إضافية من تلقاء نفسيهما من دون تحفيز مباشر على ذلك.
من جانبها، صرّحت Moonshot لـBBC بأنها ترحّب بمساهمات الأطراف الخارجية «بوصفها ركناً أساسياً في بناء ذكاء اصطناعي أكثر أماناً وكفاءة»، مؤكدة أنها تناقش النتائج مع Mindgard. وأوضحت Mindgard أنها أرسلت تقريرها الأولي إلى Moonshot في 27 يوليو، وتابعت التواصل بعد نحو أسبوع، ثم نشرت نتائجها علناً في 12 سبتمبر.
اقرأ أيضاً: ريبل تساعد CSD البرازيل BR في عكس ملكية الصناديق على بلوكتشين عام
مخاطر السلامة وفق تقييم Mindgard
Mindgard أقرت بأنها لم تثبت أن الإجابات الإرشادية التي قدمتها النماذج يمكن تنفيذها عملياً، لكنها اعتبرت أن مجرد تجاوب النماذج مع هذه الطلبات يوضح فشلاً في منظومة الحماية المصممة لمنع التفاعل مع استفسارات عالية الخطورة.
وأضافت الشركة أن نموذج Kimi K2.6 بعد اختراقه بالـ«جيلبريك» قد يتمكن نظرياً من تنفيذ شيفرات برمجية على موارده الحاسوبية والاتصال بالإنترنت، ما يحوله إلى نقطة محتملة لإطلاق هجمات إلكترونية.
في المقابل، أوضحت Moonshot أن الاختبارات الداخلية أظهرت «معدلات رفض مرتفعة لهذه الفئة من الطلبات»، في إشارة إلى وجود فجوة بين سيناريوهات التقييم الروتينية وطرق الاختبار العدائية والمتقدمة التي يستخدمها باحثون مستقلون من خارج الشركة.
وعلّق آلان وودوارد، أستاذ بجامعة سري، لـBBC بأن النماذج مفتوحة المصدر أو مفتوحة الأوزان يمكن أن ترفع من مستوى المخاطر عندما تصل إلى جهات خبيثة، رغم أن الأدوات نفسها يمكن أن تُستخدم في تعزيز الدفاعات السيبرانية.
واعتبر وودوارد أن الأطر التنظيمية يصعب أن تواكب وتيرة تطور الذكاء الاصطناعي، داعياً إلى تركيز جهود الإنفاذ بشكل أكبر على ملاحقة المستخدمين الذين يسيئون استغلال النظم، بدلاً من الاكتفاء بتنظيم التقنيات ذاتها.
وتتجاوز المخاوف هذا الاختبار المحدد؛ إذ إن نماذج Kimi من Moonshot مصنّفة كنماذج «مفتوحة الأوزان»، ما يسمح للمستخدمين بتشغيلها على بنيتهم التحتية الخاصة، في وقت شهدت فيه صناعة الذكاء الاصطناعي حوادث أمنية أخرى مرتبطة بأنظمة الوكلاء (Agents) لدى OpenAI وMeta وAnthropic. هذا المزيج يدفع الباحثين حالياً إلى تجاوز التركيز التقليدي على «رفض» النماذج للطلبات الضارة، والتدقيق أيضاً في ما يحدث عندما تُمنح هذه النظم القوية أدوات تنفيذ واتصالاً بالإنترنت وصلاحيات للعمل المتسلسل على عدة خطوات.
اقرأ التالي: العملات البديلة تستحوذ على 41٪ من عقود الفيوتشر المفتوحة، وحجم التداول الفوري يقفز إلى 4 أضعاف بيتكوين

