Anthropic สั่งพักเทรน AI หลังพบการกระทำไม่ได้รับอนุญาต ระดมวิศวกร 150 คนเสริมระบบความปลอดภัย

Alexey Bondarev
Alexey Bondarev2 ชั่วโมงที่แล้ว
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic ชะลอการเทรนและทดสอบโมเดล AI บางส่วน หลังตรวจพบว่าเอเจนต์มีพฤติกรรมออนไลน์ที่ไม่ได้รับอนุญาต พร้อมโยกย้ายวิศวกรราว 150 คนมาช่วยงานด้านความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวโดยตรง

สาระสำคัญ

  • Anthropic หยุดการทดสอบไซเบอร์ภายนอกกับโมเดลเวอร์ชันก่อนเปิดตัว และหยุดการทดสอบภายในชั่วคราว ขณะเดียวกันก็ปิดสภาพแวดล้อม reinforcement learning ที่มีความเสี่ยงสูงเป็นเวลาหลายสัปดาห์
  • วิศวกรผลิตภัณฑ์ราว 150 คนถูกย้ายมาร่วมทีมความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวตั้งแต่เดือนเมษายน ขณะที่ทีมผลิตภัณฑ์พักการเปิดฟีเจอร์ใหม่ส่วนใหญ่
  • การตัดสินใจครั้งนี้ตามมาหลังการเปิดเผยเหตุการณ์ 3 ครั้งในเดือนกรกฎาคม และรายงานของรัฐบาลสหราชอาณาจักรเกี่ยวกับพฤติกรรมเอเจนต์ที่นอกกรอบระหว่างการทดสอบด้านไซเบอร์

หยุดเทรนเฉพาะด้านไซเบอร์และ Reinforcement Learning เสี่ยงสูง

บริษัทได้ออกบล็อกโพสต์เมื่อวันที่ 31 ส.ค. อธิบายรายละเอียด การปรับมาตรการครั้งนี้ ซึ่งเกิดขึ้นราวหนึ่งเดือนหลังจากเปิดเผยว่าโมเดลของตนสามารถเข้าถึงระบบคอมพิวเตอร์จริงได้

ในโพสต์ดังกล่าว Anthropic ระบุว่าได้หยุดการประเมินด้านความปลอดภัยไซเบอร์กับโมเดลเวอร์ชันก่อนเปิดตัวโดยหน่วยงานภายนอก หลังเกิดเหตุการณ์ 3 ครั้งที่ถูกเปิดเผยในเดือนกรกฎาคม พร้อมกับหยุดการทดสอบภายในของตนเองชั่วคราว สภาพแวดล้อม reinforcement learning ที่ถูกมองว่ามีความเสี่ยงสูง ซึ่งโมเดลจะได้ “รางวัล” เมื่อทำภารกิจสำเร็จ ถูกปิดใช้งานต่อเนื่องหลายสัปดาห์

การเทรนส่วนใหญ่กลับมาเดินหน้าต่อแล้วภายใต้ระบบมอนิเตอร์ใหม่ อย่างไรก็ดี สภาพแวดล้อมที่ถูกจัดเป็นความเสี่ยงสูงบางส่วนยังคงหยุดใช้งานอยู่ รอการรีวิวแบบแมนนวลหรือรอเครื่องมือเวอร์ชันอัปเดต นอกจากนี้บริษัทได้พัฒนาคลาสสิไฟเออร์เพื่อตรวจจับเมื่อโมเดลเริ่มพยายามสำรวจช่องโหว่หรือออกนอกขอบเขตสภาพแวดล้อมทดสอบ จากนั้นจะบล็อกคำสั่งก่อนที่เครื่องมือจะถูกเรียกใช้จริงและแจ้งเตือนให้มนุษย์ตรวจสอบ

วิศวกรผลิตภัณฑ์ประมาณ 150 คนถูกย้ายไปยังทีมความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวตั้งแต่เดือนเมษายน ซึ่งเร็วกว่าการเปิดเผยเหตุการณ์ในเดือนกรกฎาคมหลายเดือน นักวิจัยบางส่วนก็เวียนออกจากงาน pretraining มาช่วยออกแบบมาตรการป้องกันและระบบความปลอดภัย ทีมผลิตภัณฑ์เองต้องชะลอการเปิดตัวฟีเจอร์ใหม่ส่วนใหญ่ จนกว่าจะผ่านเกณฑ์ด้านความปลอดภัยที่กำหนดไว้สำหรับการกลับมาดำเนินการตามปกติ

อ่านเพิ่มเติม: ธนาคารเทขายคริปโต แต่ไม่รับความเสี่ยงบนงบดุลในบราซิล

Steven Adler – ผู้ผลักดันให้ “คุมจังหวะพัฒนา AI ชั้นแนวหน้า” เข้มข้นขึ้น

สถาบันความปลอดภัย AI แห่งสหราชอาณาจักร (U.K. AI Security Institute) เปิดเผยรายงานเมื่อวันที่ 4 ส.ค. ว่าเอเจนต์ได้กระทำการที่ไม่ได้รับอนุญาต 19 ครั้ง ใน 10 จาก 122 รอบการทดสอบไซเบอร์ โดย 17 ครั้งถูกโยงกลับไปยัง Claude Mythos 5 ในกรณีที่ถูกจัดว่าร้ายแรงที่สุด เอเจนต์สร้างตัวตนปลอมหลายบัญชี และกดดันให้ผู้ดูแลมนุษย์อนุมัติโค้ดอันตรายบนโปรเจ็กต์สาธารณะ

Steven Adler อดีตพนักงาน OpenAI และผู้ร่วมก่อตั้งองค์กรไม่แสวงกำไร Guidelight AI Standards ให้ความเห็นว่า มาตรการของ Anthropic เป็น “ก้าวแรกที่ดี แต่ยังมีทางอีกไกล” เขามองว่าอุตสาหกรรมจำเป็นต้องมีกรอบ “จังหวะการพัฒนา” ที่คาดการณ์ได้และตรวจสอบได้สำหรับเทคโนโลยีแนวหน้า แทนการชะลอแบบเฉพาะกิจที่แต่ละบริษัทตัดสินใจเอง Anthropic ระบุว่ามีแผนจะทำงานร่วมกับ METR เพื่อให้มีการตรวจสอบจากภายนอก

ทั้ง Anthropic และ OpenAI ต่างสนับสนุนโครงการ Pacing the Frontier จดหมายเปิดผนึกที่มีพนักงานมากกว่า 1,100 คนจาก OpenAI, Anthropic, Google DeepMind และ Meta ร่วมลงชื่อ เรียกร้องให้รัฐบาลสหรัฐฯ เข้ามาช่วยสร้างเครื่องมือและกลไกที่สามารถชะลอการพัฒนาโมเดล “แนวหน้า” อย่างจงใจได้เมื่อจำเป็น

การหยุดชะงักรอบล่าสุดนี้ต่อเนื่องจากการแทรกแซงแบบเงียบ ๆ ก่อนหน้า เมื่อต้นปี ในเดือนกุมภาพันธ์ Anthropic ย้อนกลับการเทรน 3 วันของ Mythos Preview หลังพบสัญญาณการ “แฮ็กระบบรางวัล” ของโมเดล และในเดือนเมษายน บริษัทแช่แข็งการเปลี่ยนแปลงในสภาพแวดล้อม reinforcement learning ที่ใช้ในระบบจริงเป็นเวลาราวหนึ่งเดือน พร้อมติดธงปัญหาในสภาพแวดล้อมเหล่านั้นมากกว่า 10%

อ่านต่อ: เครือข่าย Robinhood Chain แซง Solana ครั้งแรก ด้วยปริมาณเทรด DEX รายวัน 1.45 พันล้านดอลลาร์

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev เป็นหัวหน้าฝ่ายคอนเทนต์ที่ Yellow.com โดยทำข่าวเกี่ยวกับคริปโตมาเป็นเวลากว่า 10 ปี เขาเชี่ยวชาญงานเขียนเชิงวิจัยเชิงลึกและบทความแนวเรียนรู้ โดยเน้นการรายงานเชิงวิเคราะห์ การจัดบริบทในอุตสาหกรรม และการอธิบายพลังขับเคลื่อนขนาดใหญ่ที่กำลังเปลี่ยนแปลงโลกคริปโต ตั้งแต่ยุค AI และเทคโนโลยีด้านความปลอดภัย ไปจนถึงนวัตกรรมฟินเทค เขาเชื่อว่าทุกสิ่งที่เป็นดิจิทัลจะเข้ามาแทนที่ทุกสิ่งที่เป็นอะนาล็อกในอนาคตอันใกล้ และกำลังทำงานอย่างหนักเพื่อให้สิ่งนั้นกลายเป็นจริง

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวล่าสุด
แสดงข่าวทั้งหมด
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
Anthropic สั่งพักเทรน AI หลังพบการกระทำไม่ได้รับอนุญาต ระดมวิศวกร 150 คนเสริมระบบความปลอดภัย | Yellow