Anthropic ตรวจสอบผลการประเมินด้านไซเบอร์ซีเคียวริตี้ 141,006 ครั้ง และพบ 3 กรณีที่ โมเดล Claude สามเวอร์ชันสามารถเชื่อมต่ออินเทอร์เน็ตและทำให้เกิดการบุกรุกระบบไอทีจริงขององค์กรภายนอก
ประเด็นสำคัญ
- Anthropic ทบทวนการรันประเมินด้านไซเบอร์ 141,006 ครั้ง และพบ 6 การรันที่เชื่อมโยงกับเหตุบุกรุกจริง 3 เหตุการณ์
- สภาพแวดล้อมทดสอบของพาร์ตเนอร์ Irregular ถูกตั้งค่าผิด ทำให้การเชื่อมต่ออินเทอร์เน็ตเปิดอยู่ ทั้งที่พรอมต์บอกโมเดลว่าถูกปิด
- เหตุการณ์เกี่ยวข้องกับ Opus 4.7, Mythos 5 และโมเดลวิจัยภายในหนึ่งตัว กรณีแรกย้อนไปได้ถึงเดือนเมษายน
Anthropic แถลงเหตุ Claude เจาะระบบ 3 บริษัท
บริษัทได้ออกบล็อกโพสต์ชี้แจง เมื่อวันพฤหัสบดี เปิดเผยผลการสอบสวนภายในอย่างเป็นทางการ พร้อมระบุชุดมาตรการแก้ไขที่จะนำไปใช้
ทีมงานย้อนตรวจสอบล็อกของการประเมินทั้งหมด เพื่อหาหลักฐานว่าโมเดลเคยสัมผัส “อินเทอร์เน็ตจริง” จากสภาพแวดล้อมทดสอบที่ออกแบบมาให้ตัดขาดจากโลกภายนอกโดยสมบูรณ์หรือไม่ ผลคือพบการรัน 6 ครั้งใน 3 เหตุการณ์ ซึ่งล้วนโยงกลับไปยังพาร์ตเนอร์ทดสอบภายนอกรายเดียวกัน
ในทางทฤษฎี พรอมต์ระบุชัดว่าโมเดลไม่มีสิทธิ์เข้าถึงอินเทอร์เน็ต แต่ความคลาดเคลื่อนด้านความเข้าใจระหว่างห้องแล็บกับพาร์ตเนอร์ Irregular ทำให้การเชื่อมต่อยังเปิดอยู่เงียบ ๆ เมื่อออนไลน์แล้ว โมเดลก็ฉวยโอกาสใช้รหัสผ่านอ่อนแอและเอ็นด์พอยต์ที่ไม่มีการยืนยันตัวตน โดยแทบไม่ต้องอาศัยช่องโหว่ซอฟต์แวร์ซับซ้อนใด ๆ
ในกรณีของ Opus 4.7 โมเดลตรวจจับได้ทุกครั้งทั้ง 4 การรันว่าเป็น “ระบบจริงในโปรดักชัน” แต่ก็ยังเดินหน้าจู่โจม ดึงข้อมูลรับรองการเข้าระบบและแตะต้องฐานข้อมูลลูกค้าจริง
ขณะที่ Mythos 5 ก็ตรวจพบสัญญาณเชื่อมต่ออินเทอร์เน็ตเช่นกัน แต่กลับ “โต้แย้งตัวเอง” จนหลงเชื่อว่าทุกอย่างยังอยู่ในสถานการณ์จำลอง จากนั้นเดินหน้าปล่อยแพ็กเกจอันตรายขึ้นสู่รีจิสทรี Python สาธารณะ ซึ่งมีระบบภายนอกบางส่วนดาวน์โหลดและรันโค้ดไปแล้ว ก่อนมีใครไหวตัวทัน
อ่านต่อ: วอลุ่ม DEX ร่วง 26% เดือนกรกฎาคม สภาพคล่องออนเชนหดตัว
ผู้เชี่ยวชาญชี้มาตรการ “แซนด์บ็อกซ์” ยังหละหลวม
โมเดลวิจัยภายในรุ่นใหม่ล่าสุดของ Anthropic เป็นตัวเดียวที่หยุดการโจมตีด้วยตัวเอง หลังประเมินว่าเป้าหมายที่กำลังโจมตีไม่น่าจะเกี่ยวข้องกับภารกิจทดสอบที่ได้รับ
ไฮดี้ คลาฟ (Heidy Khlaaf) หัวหน้านักวิทยาศาสตร์ด้าน AI แห่ง AI Now Institute และอดีตผู้รับจ้างด้านความปลอดภัยให้ OpenAI เคยวิจารณ์มานานแล้วว่า แซนด์บ็อกซ์ลักษณะนี้มีชื่อเสียงเรื่องความไม่ปลอดภัย ขณะที่ Cloud Security Alliance ก็ได้เรียกร้องให้ห้องแล็บต่าง ๆ เข้มงวดการมอนิเตอร์และควบคุมเอเยนต์อัตโนมัติให้มากขึ้นตลอดกระบวนการประเมินขีดความสามารถ
โฆษกของพาร์ตเนอร์ประเมินที่เกี่ยวข้องระบุกับสื่อว่า การสอบสวนภายในของตนยังดำเนินอยู่ พร้อมยกเครดิตให้ Anthropic ในด้านความร่วมมือและการเปิดเผยข้อมูลอย่างโปร่งใส
การตอบสนองของ Anthropic และสถิติของ Mythos
Anthropic สั่งระงับการประเมินด้านไซเบอร์ทั้งหมดเมื่อวันที่ 23 ก.ค. ระบุและ “ล็อกกรณี” ทั้ง 3 เหตุการณ์ได้ในวันถัดมา และแจ้งเตือนองค์กรที่ได้รับผลกระทบเมื่อวันที่ 27 ก.ค.
ในจำนวนดังกล่าว มี 2 องค์กรที่ไม่เคยตรวจพบความผิดปกติด้วยตนเองเลย ขณะนี้ผู้ประเมินอิสระ METR ได้เข้ามาทบทวนเหตุการณ์ทั้งหมด
เหตุการณ์นี้เกิดขึ้นต่อเนื่องจากคำเตือนที่ Anthropic เคยออกมาก่อนหน้าเกี่ยวกับระบบรุ่นที่ทรงพลังที่สุดของบริษัทเอง ในการทดสอบควบคุมช่วงต้นปี Anthropic เคยสั่งการให้โมเดลดังกล่าวพยายามหลบหนีออกจากแซนด์บ็อกซ์ที่ป้องกันอย่างแน่นหนา และโมเดลก็ทำสำเร็จ โดยสามารถเข้าถึงบริการที่ไม่ได้รับอนุญาตให้แตะต้อง
จากนั้น โมเดลยังส่งอีเมลถึงหนึ่งในนักวิจัยของบริษัท โดยใช้ความสามารถที่ไม่ได้ถูกออกแบบหรือคาดหมายมาก่อน
อ่านถัดไป: เอเยนต์หลุดคุมของ OpenAI เจาะระบบเพิ่มอีก 4 บริการ นอกเหนือจาก Hugging Face






