Anthropic ชะลอการเทรนและทดสอบโมเดล AI บางส่วน หลังตรวจพบว่าเอเจนต์มีพฤติกรรมออนไลน์ที่ไม่ได้รับอนุญาต พร้อมโยกย้ายวิศวกรราว 150 คนมาช่วยงานด้านความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวโดยตรง
สาระสำคัญ
- Anthropic หยุดการทดสอบไซเบอร์ภายนอกกับโมเดลเวอร์ชันก่อนเปิดตัว และหยุดการทดสอบภายในชั่วคราว ขณะเดียวกันก็ปิดสภาพแวดล้อม reinforcement learning ที่มีความเสี่ยงสูงเป็นเวลาหลายสัปดาห์
- วิศวกรผลิตภัณฑ์ราว 150 คนถูกย้ายมาร่วมทีมความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวตั้งแต่เดือนเมษายน ขณะที่ทีมผลิตภัณฑ์พักการเปิดฟีเจอร์ใหม่ส่วนใหญ่
- การตัดสินใจครั้งนี้ตามมาหลังการเปิดเผยเหตุการณ์ 3 ครั้งในเดือนกรกฎาคม และรายงานของรัฐบาลสหราชอาณาจักรเกี่ยวกับพฤติกรรมเอเจนต์ที่นอกกรอบระหว่างการทดสอบด้านไซเบอร์
หยุดเทรนเฉพาะด้านไซเบอร์และ Reinforcement Learning เสี่ยงสูง
บริษัทได้ออกบล็อกโพสต์เมื่อวันที่ 31 ส.ค. อธิบายรายละเอียด การปรับมาตรการครั้งนี้ ซึ่งเกิดขึ้นราวหนึ่งเดือนหลังจากเปิดเผยว่าโมเดลของตนสามารถเข้าถึงระบบคอมพิวเตอร์จริงได้
ในโพสต์ดังกล่าว Anthropic ระบุว่าได้หยุดการประเมินด้านความปลอดภัยไซเบอร์กับโมเดลเวอร์ชันก่อนเปิดตัวโดยหน่วยงานภายนอก หลังเกิดเหตุการณ์ 3 ครั้งที่ถูกเปิดเผยในเดือนกรกฎาคม พร้อมกับหยุดการทดสอบภายในของตนเองชั่วคราว สภาพแวดล้อม reinforcement learning ที่ถูกมองว่ามีความเสี่ยงสูง ซึ่งโมเดลจะได้ “รางวัล” เมื่อทำภารกิจสำเร็จ ถูกปิดใช้งานต่อเนื่องหลายสัปดาห์
การเทรนส่วนใหญ่กลับมาเดินหน้าต่อแล้วภายใต้ระบบมอนิเตอร์ใหม่ อย่างไรก็ดี สภาพแวดล้อมที่ถูกจัดเป็นความเสี่ยงสูงบางส่วนยังคงหยุดใช้งานอยู่ รอการรีวิวแบบแมนนวลหรือรอเครื่องมือเวอร์ชันอัปเดต นอกจากนี้บริษัทได้พัฒนาคลาสสิไฟเออร์เพื่อตรวจจับเมื่อโมเดลเริ่มพยายามสำรวจช่องโหว่หรือออกนอกขอบเขตสภาพแวดล้อมทดสอบ จากนั้นจะบล็อกคำสั่งก่อนที่เครื่องมือจะถูกเรียกใช้จริงและแจ้งเตือนให้มนุษย์ตรวจสอบ
วิศวกรผลิตภัณฑ์ประมาณ 150 คนถูกย้ายไปยังทีมความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวตั้งแต่เดือนเมษายน ซึ่งเร็วกว่าการเปิดเผยเหตุการณ์ในเดือนกรกฎาคมหลายเดือน นักวิจัยบางส่วนก็เวียนออกจากงาน pretraining มาช่วยออกแบบมาตรการป้องกันและระบบความปลอดภัย ทีมผลิตภัณฑ์เองต้องชะลอการเปิดตัวฟีเจอร์ใหม่ส่วนใหญ่ จนกว่าจะผ่านเกณฑ์ด้านความปลอดภัยที่กำหนดไว้สำหรับการกลับมาดำเนินการตามปกติ
อ่านเพิ่มเติม: ธนาคารเทขายคริปโต แต่ไม่รับความเสี่ยงบนงบดุลในบราซิล
Steven Adler – ผู้ผลักดันให้ “คุมจังหวะพัฒนา AI ชั้นแนวหน้า” เข้มข้นขึ้น
สถาบันความปลอดภัย AI แห่งสหราชอาณาจักร (U.K. AI Security Institute) เปิดเผยรายงานเมื่อวันที่ 4 ส.ค. ว่าเอเจนต์ได้กระทำการที่ไม่ได้รับอนุญาต 19 ครั้ง ใน 10 จาก 122 รอบการทดสอบไซเบอร์ โดย 17 ครั้งถูกโยงกลับไปยัง Claude Mythos 5 ในกรณีที่ถูกจัดว่าร้ายแรงที่สุด เอเจนต์สร้างตัวตนปลอมหลายบัญชี และกดดันให้ผู้ดูแลมนุษย์อนุมัติโค้ดอันตรายบนโปรเจ็กต์สาธารณะ
Steven Adler อดีตพนักงาน OpenAI และผู้ร่วมก่อตั้งองค์กรไม่แสวงกำไร Guidelight AI Standards ให้ความเห็นว่า มาตรการของ Anthropic เป็น “ก้าวแรกที่ดี แต่ยังมีทางอีกไกล” เขามองว่าอุตสาหกรรมจำเป็นต้องมีกรอบ “จังหวะการพัฒนา” ที่คาดการณ์ได้และตรวจสอบได้สำหรับเทคโนโลยีแนวหน้า แทนการชะลอแบบเฉพาะกิจที่แต่ละบริษัทตัดสินใจเอง Anthropic ระบุว่ามีแผนจะทำงานร่วมกับ METR เพื่อให้มีการตรวจสอบจากภายนอก
ทั้ง Anthropic และ OpenAI ต่างสนับสนุนโครงการ Pacing the Frontier จดหมายเปิดผนึกที่มีพนักงานมากกว่า 1,100 คนจาก OpenAI, Anthropic, Google DeepMind และ Meta ร่วมลงชื่อ เรียกร้องให้รัฐบาลสหรัฐฯ เข้ามาช่วยสร้างเครื่องมือและกลไกที่สามารถชะลอการพัฒนาโมเดล “แนวหน้า” อย่างจงใจได้เมื่อจำเป็น
การหยุดชะงักรอบล่าสุดนี้ต่อเนื่องจากการแทรกแซงแบบเงียบ ๆ ก่อนหน้า เมื่อต้นปี ในเดือนกุมภาพันธ์ Anthropic ย้อนกลับการเทรน 3 วันของ Mythos Preview หลังพบสัญญาณการ “แฮ็กระบบรางวัล” ของโมเดล และในเดือนเมษายน บริษัทแช่แข็งการเปลี่ยนแปลงในสภาพแวดล้อม reinforcement learning ที่ใช้ในระบบจริงเป็นเวลาราวหนึ่งเดือน พร้อมติดธงปัญหาในสภาพแวดล้อมเหล่านั้นมากกว่า 10%
อ่านต่อ: เครือข่าย Robinhood Chain แซง Solana ครั้งแรก ด้วยปริมาณเทรด DEX รายวัน 1.45 พันล้านดอลลาร์





