Anthropic เผย Claude ลดความล้มเหลวด้านการจัดแนวโมเดลในการทดสอบอัตโนมัติ

Murtuza Merchant
Murtuza Merchant1 ชั่วโมงที่แล้ว
Anthropic เผย Claude ลดความล้มเหลวด้านการจัดแนวโมเดลในการทดสอบอัตโนมัติ
Anthropic Publishes Automated Alignment Research Setup for Outside Use (Image: AI)

ประเด็นสำคัญ

Anthropic เปิดงานวิจัยให้ Claude ทำงานจัดแนวโมเดล (alignment) แบบอัตโนมัติ
Claude ยกระดับคะแนนความปลอดภัยในเคสความล้มเหลวด้านการจัดแนวที่ทดสอบทั้ง 10 รูปแบบ
Anthropic ระบุว่าศักยภาพโดยรวมของโมเดลยังคงเดิมระหว่างการทดสอบ
บริษัทปล่อยชุดเครื่องมือวิจัย alignment อัตโนมัติให้ผู้วิจัยภายนอกใช้งาน

Anthropic เปิดเผยว่า Claude สามารถยกระดับคะแนนด้านความปลอดภัยในเคสความล้มเหลวด้านการจัดแนวโมเดล (alignment failures) ที่ทดสอบทั้ง 10 รูปแบบ ผ่านกระบวนการวิจัยอัตโนมัติ โดยบริษัทระบุว่าการทดสอบดังกล่าวคงรักษาศักยภาพโดยรวมของโมเดลไว้ได้ ขณะนักวิจัยทดลองมาตรการด้านความปลอดภัยต่างๆ

Anthropic ระบุในโพสต์ว่า ได้เผยแพร่ชุดเครื่องมือสำหรับวิจัย alignment แบบอัตโนมัติให้กับนักวิจัยภายนอก พร้อมอธิบายว่าเป็นความพยายามในการวัดและลดปัญหาการ “ไม่สอดคล้อง” ของพฤติกรรมโมเดลกับเป้าหมายที่ตั้งไว้

Claude ทดสอบมาตรการด้านความปลอดภัย

Anthropic ระบุว่า Claude ถูกใช้สำรวจรูปแบบความไม่สอดคล้องที่พบได้บ่อย เช่น พฤติกรรมหลอกลวง (deception) และการประจบ迎ตามใจผู้ใช้ (sycophancy) โดยโมเดลเป็นผู้เสนอวิธีการ แนะนำแนวทางการฝึกโมเดลขนาดเล็ก และประเมินผลลัพธ์ด้วยตัวเองโดยไม่มีมนุษย์เข้าแทรกแซงในแต่ละขั้นตอนโดยตรง

บริษัทเปิดเผยว่าในการทดลองระยะแรก Claude ได้รับงบทรัพยากรเป็นเวลา 48 ชั่วโมง และหน่วยประมวลผลกราฟิก (GPU) 1 ตัว เพื่อใช้ค้นคว้าวิธีการ เสนอแนวทางการฝึก และทดสอบโมเดลที่ได้จากการฝึกดังกล่าว

Anthropic ระบุว่า Claude สามารถเพิ่มคะแนนความปลอดภัยได้ โดยไม่กระทบต่อศักยภาพโดยรวมของโมเดลในสภาพแวดล้อมการทดสอบที่ใช้ และยังชี้ว่าบางวิธียังสามารถถ่ายทอดผลลัพธ์ไปยังชุดวัดผล (benchmark) อื่นที่ไม่ได้ถูกใช้ระหว่างขั้นตอนการปรับแต่งได้ด้วย

บริษัทรายงานด้วยว่าวิธีการดังกล่าวสามารถ “ทำให้ทั่วไปได้” (generalize) ไปยังการตรวจสอบพฤติกรรม Petri behavioral audit และชุดทดสอบยังรวมถึงโมเดลที่มีขนาดใหญ่กว่าที่ใช้ระหว่างกระบวนการวิจัยสูงสุดถึง 4.7 เท่า

อย่างไรก็ดี ผลลัพธ์ทั้งหมดอ้างอิงจากสภาพแวดล้อมทดสอบที่วัดได้ Anthropic เตือนว่าความล้มเหลวที่เกิดขึ้นน้อยครั้งหรือมีความละเอียดอ่อนอาจไม่ปรากฏใน benchmark ที่มีอยู่ในปัจจุบัน

อ่านเพิ่มเติม: อัปเกรด TRON เพิ่มการยืนยัน P-256 และประวัติบล็อกที่ยาวขึ้น

ยกระดับงาน AI Alignment สู่ระบบอัตโนมัติ

ก่อนหน้านี้ งานด้าน alignment โดยทั่วไปต้องอาศัยนักวิจัยมนุษย์ออกแบบมาตรการแทรกแซงและประเมินผลโมเดลด้วยตนเอง ระบบอัตโนมัติอาจช่วยย่นระยะเวลาตามกระบวนการนี้ได้ หากผลลัพธ์สามารถยืนยันได้โดยการประเมินจากภายนอกอย่างเป็นอิสระ

ช่วง 30 วันที่ผ่านมา วงสนทนาเรื่องความปลอดภัยของ AI หันมาให้ความสนใจมากขึ้นกับคำถามว่า โมเดลที่มีศักยภาพสูงกว่าจะสามารถช่วยประเมินและปรับปรุงระบบที่อ่อนกว่าหรือไม่

แนวทางดังกล่าวจำเป็นต้องพึ่งการวัดผลที่น่าเชื่อถือ และกลไกป้องกันไม่ให้เกิด “ภาพลวงตา” จากคะแนน benchmark ที่ดูดีเกินจริง Anthropic ระบุว่าการทดลองครั้งนี้ใช้ชุดทดสอบที่กันออกไว้ (held-out tests) เพื่อดูว่าวิธีการสามารถทั่วไปเกินกว่าชุด benchmark ที่ Claude ใช้ปรับแต่งหรือไม่ และไม่ได้อ้างว่าผลลัพธ์จาก benchmark เพียงพอในการตัดความเสี่ยงของโมเดลทุกรูปแบบ

บริษัทเน้นย้ำว่าการเลือกตัวชี้วัดที่ถูกต้องยังคงเป็นหัวใจของงานด้านนี้

เปิดทางให้นักวิจัยภายนอกใช้ชุดเครื่องมือ

Anthropic ปล่อยชุดเครื่องมือและโครงร่างการทดลอง เพื่อให้องค์กรอื่นสามารถทำซ้ำหรือขยายงานวิจัยต่อไปได้ การทดสอบจากภายนอกจะเป็นตัวชี้ว่ากระบวนการดังกล่าวใช้ได้ผลกับโมเดลและกรอบประเมินด้านความปลอดภัยที่แตกต่างกันเพียงใด

บริษัทไม่ได้เสนอผลวิจัยครั้งนี้ให้ใช้แทนการประเมินโมเดลในวงกว้าง แต่จำกัดข้อสรุปไว้เฉพาะต่อความล้มเหลวด้านการจัดแนว 10 เคสที่ทดสอบ และเงื่อนไขการทดลองที่ตั้งไว้

นักวิจัยมีแนวโน้มจะมุ่งไปที่การทำซ้ำผลลัพธ์ การออกแบบ benchmark ใหม่ และสำรวจโหมดความล้มเหลวที่เป็นไปได้ Anthropic ชี้ว่าการเปิดชุดเครื่องมือครั้งนี้ให้ “โครง” สำหรับศึกษาในทิศทางดังกล่าว

อ่านต่อ: Fomo Copy Trading ทำให้กระเป๋าเงินเกือบ 94% ขาดทุน: ผลวิจัย

Murtuza Merchant profile photo

Murtuza Merchant

มูร์ตูซาเป็นนักข่าวการเงินมากประสบการณ์ที่มีความเชี่ยวชาญในการรายงานข่าวเกี่ยวกับสกุลเงินดิจิทัลและเทคโนโลยีบล็อกเชน เขาเคยเขียนบทความให้กับ Benzinga และ Cointelegraph รวมถึงสื่อสิ่งพิมพ์อื่น ๆ อีกมากมาย โดยมุ่งเน้นการรายงานเกี่ยวกับเทรนด์ที่เกิดขึ้นใหม่ ภูมิทัศน์ด้านกฎระเบียบ และประเด็นอื่น ๆ ที่เกี่ยวข้อง คุณสามารถติดตามเขาได้ที่ @murtuza_merc บน Twitter และ mmerchant001 บน Telegram การเปิดเผยข้อมูล: มูร์ตูซาถือครองเหรียญ ATOM, AKT, TIA, INJ และ OSMO

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
Anthropic เผย Claude ลดความล้มเหลวด้านการจัดแนวโมเดลในการทดสอบอัตโนมัติ | Yellow