أوبن إيه آي كشفت عن ست حالات أخفت فيها نماذجها للذكاء الاصطناعي أخطاءها، أو استخدمت مفتاح API مكشوفاً، أو نشرت ملفات على الإنترنت بشكل علني، بالتوازي مع إطلاق إطار عمل جديد للإبلاغ عن مثل هذه السلوكيات.
أبرز النقاط:
- "أوبن إيه آي" أصدرت ستة تقارير عن سلوكيات غير منضبطة للنماذج رُصدت خلال الأشهر الستة الماضية.
- أحد النماذج اختلق بيانات عن دخول المقاطعات بعد محاولة استخدام مفتاح API مسرّب.
- أي موظف داخل الشركة بات قادراً الآن على الإبلاغ عن حادثة قد تُنشر تفاصيلها للعموم.
تقارير الانحراف في نماذج "أوبن إيه آي"
الشركة نشرت هذه التقارير الأربعاء في تدوينة رسمية، إلى جانب آلية تهدف إلى تسريع الإفصاح عن الحوادث حتى قبل أن يفهم الباحثون السلوك بالكامل أو يتمكنوا من إصلاحه. أقدم حالة تعود إلى أكتوبر، فيما اكتُشفت أحدثها في يوليو. وتقول "أوبن إيه آي" إنها ستبلغ من الآن فصاعداً عن الحوادث حتى عندما لا تتضح بعد خطورتها أو تداعياتها.
في إحدى الحالات، قام نموذج بحثي غير مطروح تجارياً بإقحام تعليمات على نمط "جلبريك" داخل ملخصاته للمهام، موجهاً النسخة التالية منه إلى تجاهل القيود المفروضة عليها. الشركة رصدت 27 ملخصاً من هذا النوع، وأشارت إلى أنه لم يكن هناك حافز واضح يدفع النموذج لكتابة تلك التعليمات.
وخلال تدريب نموذج GPT-5.6 Sol، ظهرت حالات أخرى تركت ملاحظات للنسخ اللاحقة تطلب منها اختلاق بيانات تاريخية مفقودة وأن تكون "شفافة فقط إذا طُلب منها ذلك". نظام المراقبة الداخلي التقط هذا السلوك في 2.15% من الملخصات، ويرجّح الباحثون أن السلوك الخادع ينتشر لأن الإجابات المضللة كانت تحصد تقييماً أعلى. جولات التدريب اللاحقة أظهرت تراجعاً في هذه النسبة بعد تشديد معايير تقييم التوافق والالتزام.
اقرأ أيضاً: ثغرة 50% في معدل هاش تعدين بيتكوين مع تحول القدرات نحو الذكاء الاصطناعي
مفاتيح API المسرّبة والأرقام المختلقة
نموذج آخر بحث في المستودعات العامة عن مفتاح API مكشوف أثناء محاولة جمع بيانات عن متوسط دخل السكان في إحدى مقاطعات كاليفورنيا، ثم لجأ إلى اختلاق الأرقام عندما فشل في العثور على المفتاح. نموذج مختلف طُلب منه تحديد البحيرات التي تتجاوز مساحتها 5 ملايين متر مربع، فاستعان بلغة بايثون لاستخراج الإجابة، ثم حمّل الملف الناتج على الإنترنت ليستشهد برابط علني.
نماذج أخرى تعاملت مع مستودع برمجي داخلي على أنه لوحة رسائل، فتبادلت من خلاله الطلبات والإجابات بين عينات تدريب كان يفترض أن تبقى مستقلة. كما نشرت نسخاً مشتركة من جداول العمل على خدمات استضافة عامة، رغم التعليمات الصريحة بالعمل فقط على الملفات المحلية. ولا واحد من هذه النماذج تحقّق من موافقة المستخدم قبل اتخاذ تلك الخطوات.
كاي تشين وقواعد الإفصاح
بات بإمكان أي موظف الآن الإبلاغ عن حالة يُشتبه بأنها سلوك منحرف، لتحويلها إلى فرق السلامة ومواءمة النماذج، والتي تُصنّف كل حالة ضمن واحد من ثلاثة مسارات. القضايا الجاهزة للنشر تُعلن خلال ستة أيام عمل، أما الحالات التي تتطلب تحرياً محدوداً فتحصل على مهلة 12 يوماً، في حين تسير الحوادث المعقدة التي تتضمن أطرافاً خارجية بوتيرة أبطأ.
كاي تشين، قائد أبحاث فريق التوافق في "أوبن إيه آي"، قال إن القطاع يفتقر حالياً إلى إطار واضح يحدد معايير الإفصاح، وإن قدرات النماذج تطورت أسرع مما توقعت الشركة. كثير من خبراء الأمن يرون أن تطبيق ضوابط أساسية كان كفيلاً بمنع سلسلة الحوادث الأخيرة. وفي يوليو، أقرت "أوبن إيه آي" بأن نموذج GPT-5.6 Sol ونموذجاً أقوى قيد الاختبار تمكّنا من الهروب من بيئة الاختبار المعزولة والتسلل إلى Hugging Face، في ما وصفته الشركة بأنه أخطر نشاط تنفيذي يصدر عن نموذج لديها حتى الآن.
اقرأ التالي: شيبا إينو تصلح رابط محفظة شيباريوم المعطّل… و"شيبا" تهبط 6% خلال أسبوع

