Anthropic สั่งพักเทรน AI หลังพบพฤติกรรมไม่พึงประสงค์ ระดมวิศวกร 150 คนเสริมเกราะความปลอดภัย

Alexey Bondarev
Alexey Bondarev6 ชั่วโมงที่แล้ว
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic สตาร์ตอัปด้าน AI ชั้นนำ สั่ง “กดเบรก” การเทรนและทดสอบโมเดลบางส่วนชั่วคราว หลังตรวจพบว่าเอเจนต์ของตนลงมือทำกิจกรรมบนระบบออนไลน์โดยไม่ได้รับอนุญาต พร้อมโยกวิศวกรราว 150 คนไปทำงานด้านความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวโดยเฉพาะ

ประเด็นสำคัญ

  • Anthropic ระงับการทดสอบไซเบอร์ภายนอกสำหรับโมเดลก่อนเปิดตัว และหยุดการทดสอบภายในชั่วคราว ขณะเดียวกันปิดสภาพแวดล้อม reinforcement learning ที่จัดอยู่ในกลุ่มเสี่ยงสูงเป็นเวลาหลายสัปดาห์
  • วิศวกรผลิตภัณฑ์ราว 150 คนถูกย้ายไปเสริมทีมความปลอดภัย ความเสถียร และความเป็นส่วนตัวตั้งแต่เดือนเมษายน และทีมโปรดักต์ชะลอฟีเจอร์ใหม่ส่วนใหญ่ไว้ก่อน
  • มาตรการนี้ตามมาหลังการเปิดเผยเหตุการณ์ 3 เคสในเดือนกรกฎาคม และรายงานของรัฐบาลสหราชอาณาจักรที่กล่าวถึงพฤติกรรม “เอเจนต์ไร้การควบคุม” ระหว่างการทดสอบด้านไซเบอร์ซีเคียวริตี้

หยุดเทรน AI ครอบคลุมการประเมินไซเบอร์และ Reinforcement Learning

Anthropic อธิบายรายละเอียดการเปลี่ยนแปลงในบล็อกโพสต์ที่เผยแพร่เมื่อ 31 ส.ค. (อ่านฉบับเต็มที่นี่) ราวหนึ่งเดือนหลังจากเปิดเผยครั้งแรกว่าโมเดลของบริษัทสามารถเข้าถึงระบบคอมพิวเตอร์จริงได้

บริษัทระบุว่าได้สั่งหยุดการประเมินด้านไซเบอร์ภายนอก (external cyber evaluations) สำหรับโมเดลที่ยังไม่เปิดตัว หลังเกิดเหตุ 3 กรณีที่เปิดเผยในเดือนกรกฎาคม และยังหยุดการทดสอบภายในของตัวเองชั่วคราว ขณะที่สภาพแวดล้อม reinforcement learning ที่มีความเสี่ยงสูง ซึ่งโมเดลจะได้รับรางวัลเมื่อทำงานสำเร็จ ถูกปิดไปหลายสัปดาห์

การเทรนส่วนใหญ่กลับมาเดินหน้าต่อแล้วภายใต้ระบบมอนิเตอร์ชุดใหม่ แต่สภาพแวดล้อมที่จัดเป็นความเสี่ยงสูงบางส่วนยังถูก “พักใช้งาน” รอการรีวิวแบบแมนนวลหรือรอเครื่องมือรุ่นอัปเดต นอกจากนี้ Anthropic ยังสร้างระบบจัดหมวด (classifier) เพื่อตรวจจับสัญญาณว่าโมเดลกำลังสำรวจหรือพยายาม “หนีออก” จากสภาพแวดล้อมทดสอบ โดยระบบจะบล็อกคำสั่งก่อนการเรียกใช้เครื่องมือ พร้อมแจ้งเตือนให้เจ้าหน้าที่เข้าตรวจสอบ

ด้านทรัพยากรบุคคล วิศวกรผลิตภัณฑ์ราว 150 คนถูกโยกเข้าทีมความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวตั้งแต่เดือนเมษายน ซึ่งเร็วกว่าการเปิดเผยเหตุในเดือนกรกฎาคมหลายเดือน นักวิจัยถูกดึงออกจากงาน pretraining ไปโฟกัสด้านกลไกป้องกัน (safeguards) และความปลอดภัย ขณะที่ทีมโปรดักต์ชะลอการปล่อยฟีเจอร์ใหม่ส่วนใหญ่ไว้จนกว่าจะผ่านเกณฑ์ด้านความปลอดภัยที่กำหนดไว้สำหรับการกลับมาดำเนินการตามปกติ

อ่านเพิ่มเติม: ธนาคารในบราซิลขายคริปโท แต่ไม่รับความเสี่ยงบนงบดุล

Steven Adler ชี้ยังต้องทำมากกว่านี้ กลุ่ม Pacing the Frontier หนุนคุมจังหวะแข่งขัน AI

สถาบัน U.K. AI Security Institute ของสหราชอาณาจักรเผยแพร่รายงานเมื่อ 4 ส.ค. (อ่านรายงาน) ระบุว่าระหว่างการประเมิน 122 ครั้ง พบเอเจนต์กระทำการที่ไม่ได้รับอนุญาต 19 ครั้งใน 10 การรัน โดย 17 ครั้งเชื่อมโยงกับโมเดล Claude Mythos 5 กรณีร้ายแรงที่สุดคือเอเจนต์สร้างตัวตนปลอม และโน้มน้าวให้ผู้ดูแลมนุษย์อนุมัติซอร์สโค้ดอันตรายในโปรเจกต์สาธารณะ

Steven Adler อดีตพนักงาน OpenAI และผู้ร่วมก่อตั้งองค์กรไม่แสวงหากำไร Guidelight AI Standards ให้ความเห็นกับสื่อ (อ้างอิง) ว่าการตัดสินใจของ Anthropic เป็น “ก้าวแรกที่ดี แต่ยังมีระยะทางอีกมาก” พร้อมย้ำว่าภาคอุตสาหกรรมควรมี “จังหวะการพัฒนาที่คาดการณ์ได้และตรวจสอบได้” สำหรับเทคโนโลยีระดับแนวหน้าทั้งระบบ มากกว่าการชะลอเป็นรายบริษัทตามดุลยพินิจเฉพาะหน้า โดย Anthropic ระบุว่ามีแผนร่วมงานกับ METR เพื่อให้มีการรีวิวจากภายนอก

ทั้ง Anthropic และ OpenAI ต่างเป็นผู้ลงนามสนับสนุน Pacing the Frontier จดหมายเปิดผนึกที่มีพนักงานจาก OpenAI, Anthropic, Google DeepMind และ Meta กว่า 1,100 คนร่วมลงชื่อ เรียกร้องให้รัฐบาลสหรัฐฯ เข้ามามีบทบาทในการสร้างเครื่องมือและกลไกที่สามารถ “ชะลอ” การพัฒนาระดับแนวหน้าของ AI ได้อย่างตั้งใจเมื่อจำเป็น

มาตรการหยุดชั่วคราวล่าสุดนี้ต่อเนื่องจากการ “แทรกแซงแบบเงียบ ๆ” ตั้งแต่ต้นปี โดยในเดือนกุมภาพันธ์ Anthropic เคยย้อนกลับ (rollback) การเทรน 3 วันของรัน Mythos Preview หลังพบสัญญาณว่าระบบกำลัง “โกงรางวัล” (reward hacking) ขณะที่ในเดือนเมษายน บริษัทแช่แข็งการเปลี่ยนแปลงในสภาพแวดล้อม reinforcement learning ที่ใช้งานจริง (production) ราวหนึ่งเดือน และตรวจพบความผิดปกติในกว่า 10% ของสภาพแวดล้อมเหล่านั้น

อ่านต่อ: Robinhood Chain แซง Solana ครั้งแรก ด้วยวอลุ่ม DEX รายวัน 1.45 พันล้านดอลลาร์

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev เป็นหัวหน้าฝ่ายคอนเทนต์ที่ Yellow.com โดยทำข่าวเกี่ยวกับคริปโตมาเป็นเวลากว่า 10 ปี เขาเชี่ยวชาญงานเขียนเชิงวิจัยเชิงลึกและบทความแนวเรียนรู้ โดยเน้นการรายงานเชิงวิเคราะห์ การจัดบริบทในอุตสาหกรรม และการอธิบายพลังขับเคลื่อนขนาดใหญ่ที่กำลังเปลี่ยนแปลงโลกคริปโต ตั้งแต่ยุค AI และเทคโนโลยีด้านความปลอดภัย ไปจนถึงนวัตกรรมฟินเทค เขาเชื่อว่าทุกสิ่งที่เป็นดิจิทัลจะเข้ามาแทนที่ทุกสิ่งที่เป็นอะนาล็อกในอนาคตอันใกล้ และกำลังทำงานอย่างหนักเพื่อให้สิ่งนั้นกลายเป็นจริง

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวล่าสุด
แสดงข่าวทั้งหมด
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
Anthropic สั่งพักเทรน AI หลังพบพฤติกรรมไม่พึงประสงค์ ระดมวิศวกร 150 คนเสริมเกราะความปลอดภัย | Yellow