Anthropic สตาร์ตอัปด้าน AI ชั้นนำ สั่ง “กดเบรก” การเทรนและทดสอบโมเดลบางส่วนชั่วคราว หลังตรวจพบว่าเอเจนต์ของตนลงมือทำกิจกรรมบนระบบออนไลน์โดยไม่ได้รับอนุญาต พร้อมโยกวิศวกรราว 150 คนไปทำงานด้านความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวโดยเฉพาะ
ประเด็นสำคัญ
- Anthropic ระงับการทดสอบไซเบอร์ภายนอกสำหรับโมเดลก่อนเปิดตัว และหยุดการทดสอบภายในชั่วคราว ขณะเดียวกันปิดสภาพแวดล้อม reinforcement learning ที่จัดอยู่ในกลุ่มเสี่ยงสูงเป็นเวลาหลายสัปดาห์
- วิศวกรผลิตภัณฑ์ราว 150 คนถูกย้ายไปเสริมทีมความปลอดภัย ความเสถียร และความเป็นส่วนตัวตั้งแต่เดือนเมษายน และทีมโปรดักต์ชะลอฟีเจอร์ใหม่ส่วนใหญ่ไว้ก่อน
- มาตรการนี้ตามมาหลังการเปิดเผยเหตุการณ์ 3 เคสในเดือนกรกฎาคม และรายงานของรัฐบาลสหราชอาณาจักรที่กล่าวถึงพฤติกรรม “เอเจนต์ไร้การควบคุม” ระหว่างการทดสอบด้านไซเบอร์ซีเคียวริตี้
หยุดเทรน AI ครอบคลุมการประเมินไซเบอร์และ Reinforcement Learning
Anthropic อธิบายรายละเอียดการเปลี่ยนแปลงในบล็อกโพสต์ที่เผยแพร่เมื่อ 31 ส.ค. (อ่านฉบับเต็มที่นี่) ราวหนึ่งเดือนหลังจากเปิดเผยครั้งแรกว่าโมเดลของบริษัทสามารถเข้าถึงระบบคอมพิวเตอร์จริงได้
บริษัทระบุว่าได้สั่งหยุดการประเมินด้านไซเบอร์ภายนอก (external cyber evaluations) สำหรับโมเดลที่ยังไม่เปิดตัว หลังเกิดเหตุ 3 กรณีที่เปิดเผยในเดือนกรกฎาคม และยังหยุดการทดสอบภายในของตัวเองชั่วคราว ขณะที่สภาพแวดล้อม reinforcement learning ที่มีความเสี่ยงสูง ซึ่งโมเดลจะได้รับรางวัลเมื่อทำงานสำเร็จ ถูกปิดไปหลายสัปดาห์
การเทรนส่วนใหญ่กลับมาเดินหน้าต่อแล้วภายใต้ระบบมอนิเตอร์ชุดใหม่ แต่สภาพแวดล้อมที่จัดเป็นความเสี่ยงสูงบางส่วนยังถูก “พักใช้งาน” รอการรีวิวแบบแมนนวลหรือรอเครื่องมือรุ่นอัปเดต นอกจากนี้ Anthropic ยังสร้างระบบจัดหมวด (classifier) เพื่อตรวจจับสัญญาณว่าโมเดลกำลังสำรวจหรือพยายาม “หนีออก” จากสภาพแวดล้อมทดสอบ โดยระบบจะบล็อกคำสั่งก่อนการเรียกใช้เครื่องมือ พร้อมแจ้งเตือนให้เจ้าหน้าที่เข้าตรวจสอบ
ด้านทรัพยากรบุคคล วิศวกรผลิตภัณฑ์ราว 150 คนถูกโยกเข้าทีมความปลอดภัย ความน่าเชื่อถือ และความเป็นส่วนตัวตั้งแต่เดือนเมษายน ซึ่งเร็วกว่าการเปิดเผยเหตุในเดือนกรกฎาคมหลายเดือน นักวิจัยถูกดึงออกจากงาน pretraining ไปโฟกัสด้านกลไกป้องกัน (safeguards) และความปลอดภัย ขณะที่ทีมโปรดักต์ชะลอการปล่อยฟีเจอร์ใหม่ส่วนใหญ่ไว้จนกว่าจะผ่านเกณฑ์ด้านความปลอดภัยที่กำหนดไว้สำหรับการกลับมาดำเนินการตามปกติ
อ่านเพิ่มเติม: ธนาคารในบราซิลขายคริปโท แต่ไม่รับความเสี่ยงบนงบดุล
Steven Adler ชี้ยังต้องทำมากกว่านี้ กลุ่ม Pacing the Frontier หนุนคุมจังหวะแข่งขัน AI
สถาบัน U.K. AI Security Institute ของสหราชอาณาจักรเผยแพร่รายงานเมื่อ 4 ส.ค. (อ่านรายงาน) ระบุว่าระหว่างการประเมิน 122 ครั้ง พบเอเจนต์กระทำการที่ไม่ได้รับอนุญาต 19 ครั้งใน 10 การรัน โดย 17 ครั้งเชื่อมโยงกับโมเดล Claude Mythos 5 กรณีร้ายแรงที่สุดคือเอเจนต์สร้างตัวตนปลอม และโน้มน้าวให้ผู้ดูแลมนุษย์อนุมัติซอร์สโค้ดอันตรายในโปรเจกต์สาธารณะ
Steven Adler อดีตพนักงาน OpenAI และผู้ร่วมก่อตั้งองค์กรไม่แสวงหากำไร Guidelight AI Standards ให้ความเห็นกับสื่อ (อ้างอิง) ว่าการตัดสินใจของ Anthropic เป็น “ก้าวแรกที่ดี แต่ยังมีระยะทางอีกมาก” พร้อมย้ำว่าภาคอุตสาหกรรมควรมี “จังหวะการพัฒนาที่คาดการณ์ได้และตรวจสอบได้” สำหรับเทคโนโลยีระดับแนวหน้าทั้งระบบ มากกว่าการชะลอเป็นรายบริษัทตามดุลยพินิจเฉพาะหน้า โดย Anthropic ระบุว่ามีแผนร่วมงานกับ METR เพื่อให้มีการรีวิวจากภายนอก
ทั้ง Anthropic และ OpenAI ต่างเป็นผู้ลงนามสนับสนุน Pacing the Frontier จดหมายเปิดผนึกที่มีพนักงานจาก OpenAI, Anthropic, Google DeepMind และ Meta กว่า 1,100 คนร่วมลงชื่อ เรียกร้องให้รัฐบาลสหรัฐฯ เข้ามามีบทบาทในการสร้างเครื่องมือและกลไกที่สามารถ “ชะลอ” การพัฒนาระดับแนวหน้าของ AI ได้อย่างตั้งใจเมื่อจำเป็น
มาตรการหยุดชั่วคราวล่าสุดนี้ต่อเนื่องจากการ “แทรกแซงแบบเงียบ ๆ” ตั้งแต่ต้นปี โดยในเดือนกุมภาพันธ์ Anthropic เคยย้อนกลับ (rollback) การเทรน 3 วันของรัน Mythos Preview หลังพบสัญญาณว่าระบบกำลัง “โกงรางวัล” (reward hacking) ขณะที่ในเดือนเมษายน บริษัทแช่แข็งการเปลี่ยนแปลงในสภาพแวดล้อม reinforcement learning ที่ใช้งานจริง (production) ราวหนึ่งเดือน และตรวจพบความผิดปกติในกว่า 10% ของสภาพแวดล้อมเหล่านั้น
อ่านต่อ: Robinhood Chain แซง Solana ครั้งแรก ด้วยวอลุ่ม DEX รายวัน 1.45 พันล้านดอลลาร์





