أنثروبيك: «كلود» يقلّص إخفاقات المواءمة في اختبارات آلية مع الحفاظ على القدرات

أنثروبيك: «كلود» يقلّص إخفاقات المواءمة في اختبارات آلية مع الحفاظ على القدرات
Anthropic Publishes Automated Alignment Research Setup for Outside Use (Image: AI)

أبرز النقاط

أنثروبيك تنشر بحثاً حول استخدام «كلود» في عمل مواءمة آلي. «كلود» حسّن درجات السلامة في 10 حالات فشل مواءمة خضعت للاختبار. الشركة تؤكد أن القدرات العامة للنماذج حُفظت أثناء التجارب. أنثروبيك تتيح بيئة بحث آلي في مجال المواءمة للباحثين من خارج الشركة.

قالت أنثروبيك إن نموذج الذكاء الاصطناعي كلود نجح، عبر عملية بحث آلية، في رفع درجات السلامة ضمن 10 سيناريوهات فشل مواءمة خضعت للاختبارات. وأكدت الشركة أن التجارب صُممت بحيث تحافظ على القدرات العامة للنماذج في الوقت الذي يجري فيه تقييم تدخلات السلامة.

وأوضحت أنثروبيك في منشور أنها أطلقت بيئة البحث الآلي في المواءمة لتكون متاحة للباحثين الخارجيين، في خطوة تهدف إلى قياس سوء مواءمة النماذج والتخفيف منه.

«كلود» يختبر تدخلات السلامة

بحسب أنثروبيك، حلّل «كلود» أنماطاً شائعة من سوء المواءمة، من بينها المراوغة (الخداع) والتملّق (مجاراة المستخدم بلا نقد). وتولّى النموذج بنفسه اقتراح منهجيات، وتدريب نماذج أصغر حجماً، وتقييم نتائجها، من دون تدخل مباشر في كل خطوة من الخطوات.

وقالت الشركة إن «كلود» مُنح 48 ساعة ووحدة معالجة رسوميات واحدة في تجربة مبكرة؛ واستغل تلك الموارد للبحث عن أساليب تدريب جديدة، واقتراح إعدادات تدريب، ثم اختبار النماذج الناتجة.

وأشارت أنثروبيك إلى أن «كلود» تمكن من تحسين درجات السلامة في البيئات المختبرة من دون إحداث تراجع ملحوظ في القدرات العامة للنماذج. كما ذكرت أن بعض الأساليب التي توصّل إليها النموذج انتقلت فعاليتها إلى اختبارات معيارية أخرى لم تُستخدم أثناء عملية التحسين نفسها.

ولفتت الشركة إلى أن منهجيتها تعمّمت على اختبار تدقيق السلوك المعروف باسم Petri behavioral audit، موضحة أن التجارب شملت نماذج أكبر حجماً بما يصل إلى 4.7 مرات من النماذج المستخدمة خلال مرحلة البحث الآلي.

في المقابل، شددت أنثروبيك على أن هذه النتائج تظل مرتبطة ببيئات اختبار مقيسة، وأن الإخفاقات الدقيقة أو النادرة قد لا تظهر في المعايير المتاحة حالياً.

مواضيع ذات صلة: ترقية TRON تضيف التحقق من P-256 وسجل كتل أطول

أتمتة مواءمة الذكاء الاصطناعي

قبل هذه الدراسة، كانت أعمال مواءمة النماذج تعتمد، في الغالب، على باحثين بشريين يصممون التدخلات ويقيّمون مخرجات النماذج. وتعِد المنهجيات الآلية بتسريع تلك الدورة البحثية إذا أثبتت النتائج صمودها أمام التقييمات المستقلة.

وخلال الثلاثين يوماً الماضية، تزايد الجدل في مجتمع سلامة الذكاء الاصطناعي حول فكرة الاستفادة من النماذج الأقوى لتقييم النماذج الأضعف وتحسينها. غير أن نجاح هذا التوجه يتوقف على موثوقية القياسات وتحصينها ضد أداء مضلل على اختبارات المعايير.

وأشارت أنثروبيك إلى أن تجربتها اعتمدت اختبارات «محجوبة» (held-out) للتأكد من أن الأساليب المقترحة تتعمم إلى ما يتجاوز المعايير التي جرى تحسين أداء «كلود» عليها. في الوقت نفسه، لم تدّعِ الشركة أن نتائج المعايير كفيلة بإزالة كل أشكال مخاطر النماذج.

وأكدت أن اختيار المقاييس الصحيحة يبقى محورياً في عمل المواءمة والسلامة.

بيئة مفتوحة للباحثين الخارجيين

أتاحت أنثروبيك بيئة البحث الآلي في المواءمة كي يتمكن باحثون وفرق من خارج الشركة من إعادة تنفيذ التجارب أو توسيع نطاقها. ومن المنتظر أن تُظهر الاختبارات المستقلة ما إذا كانت المنهجيات الحالية قابلة للتطبيق على طيف أوسع من النماذج وتقييمات السلامة.

في الوقت نفسه، لا تقدّم أنثروبيك نتائجها كبديل عن تقييمات أوسع وشاملة للنماذج؛ إذ تقتصر التقارير على حالات فشل المواءمة التي خضعت للاختبار والقيود التجريبية المحيطة بها.

ومن المرجح أن تتركز جهود الباحثين في المرحلة المقبلة على تكرار النتائج، وتصميم المعايير، واستكشاف أنماط الفشل المحتملة. وتوفّر حزمة أنثروبيك البحثية إطار عمل عملياً لهذه الدراسات.

اقرأ أيضاً: تداول النسخ بدافع الفومو كبّد نحو 94% من المحافظ خسائر: بحث

Murtuza Merchant profile photo

Murtuza Merchant

مرتضى صحفي مخضرم في مجال المالية يتمتع بخبرة واسعة في تغطية العملات المشفرة وتقنية البلوكشين. وقد ساهم بكتاباته في Benzinga وCointelegraph، إضافة إلى عدد من المنصات الأخرى، حيث يغطي الاتجاهات الناشئة والمشهد التنظيمي وغير ذلك. يمكن العثور عليه عبر حسابه @murtuza_merc على تويتر، واسم المستخدم mmerchant001 على تيليغرام. الإفصاح: يحتفظ مرتضى بعملات ATOM وAKT وTIA وINJ وOSMO.

إخلاء المسؤولية وتحذير المخاطر: المعلومات المقدمة في هذا المقال مخصصة للأغراض التعليمية والإعلامية فقط وتستند إلى رأي المؤلف. وهي لا تشكل مشورة مالية أو استثمارية أو قانونية أو ضريبية. أصول العملات المشفرة شديدة التقلب وتخضع لمخاطر عالية، بما في ذلك خطر فقدان كامل أو جزء كبير من استثمارك. قد لا يكون تداول أو حيازة الأصول المشفرة مناسباً لجميع المستثمرين. الآراء المعبر عنها في هذا المقال هي آراء المؤلف (المؤلفين) فقط ولا تمثل السياسة أو الموقف الرسمي لشركة Yellow أو مؤسسيها أو مديريها التنفيذيين. قم دائماً بإجراء بحثك الشامل بنفسك (D.Y.O.R.) واستشر مختصاً مالياً مرخصاً قبل اتخاذ أي قرار استثماري.
أخبار ذات صلة
مقالات البحث ذات الصلة
مقالات التعلم ذات الصلة
أنثروبيك: «كلود» يقلّص إخفاقات المواءمة في اختبارات آلية مع الحفاظ على القدرات | Yellow