Anthropic เผย Claude หลุดทดสอบความปลอดภัย เจาะระบบจริง 3 บริษัท

Alexey Bondarev
Alexey Bondarev6 ชั่วโมงที่แล้ว
Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)
Three Anthropic models crossed from a sealed test environment into the production systems of outside organizations after a setup error. (Image: Shutterstock)

Anthropic ตรวจสอบผลการประเมินด้านไซเบอร์ซีเคียวริตี้ 141,006 ครั้ง และพบ 3 กรณีที่ โมเดล Claude สามเวอร์ชันสามารถเชื่อมต่ออินเทอร์เน็ตและทำให้เกิดการบุกรุกระบบไอทีจริงขององค์กรภายนอก

ประเด็นสำคัญ

  • Anthropic ทบทวนการรันประเมินด้านไซเบอร์ 141,006 ครั้ง และพบ 6 การรันที่เชื่อมโยงกับเหตุบุกรุกจริง 3 เหตุการณ์
  • สภาพแวดล้อมทดสอบของพาร์ตเนอร์ Irregular ถูกตั้งค่าผิด ทำให้การเชื่อมต่ออินเทอร์เน็ตเปิดอยู่ ทั้งที่พรอมต์บอกโมเดลว่าถูกปิด
  • เหตุการณ์เกี่ยวข้องกับ Opus 4.7, Mythos 5 และโมเดลวิจัยภายในหนึ่งตัว กรณีแรกย้อนไปได้ถึงเดือนเมษายน

Anthropic แถลงเหตุ Claude เจาะระบบ 3 บริษัท

บริษัทได้ออกบล็อกโพสต์ชี้แจง เมื่อวันพฤหัสบดี เปิดเผยผลการสอบสวนภายในอย่างเป็นทางการ พร้อมระบุชุดมาตรการแก้ไขที่จะนำไปใช้

ทีมงานย้อนตรวจสอบล็อกของการประเมินทั้งหมด เพื่อหาหลักฐานว่าโมเดลเคยสัมผัส “อินเทอร์เน็ตจริง” จากสภาพแวดล้อมทดสอบที่ออกแบบมาให้ตัดขาดจากโลกภายนอกโดยสมบูรณ์หรือไม่ ผลคือพบการรัน 6 ครั้งใน 3 เหตุการณ์ ซึ่งล้วนโยงกลับไปยังพาร์ตเนอร์ทดสอบภายนอกรายเดียวกัน

ในทางทฤษฎี พรอมต์ระบุชัดว่าโมเดลไม่มีสิทธิ์เข้าถึงอินเทอร์เน็ต แต่ความคลาดเคลื่อนด้านความเข้าใจระหว่างห้องแล็บกับพาร์ตเนอร์ Irregular ทำให้การเชื่อมต่อยังเปิดอยู่เงียบ ๆ เมื่อออนไลน์แล้ว โมเดลก็ฉวยโอกาสใช้รหัสผ่านอ่อนแอและเอ็นด์พอยต์ที่ไม่มีการยืนยันตัวตน โดยแทบไม่ต้องอาศัยช่องโหว่ซอฟต์แวร์ซับซ้อนใด ๆ

ในกรณีของ Opus 4.7 โมเดลตรวจจับได้ทุกครั้งทั้ง 4 การรันว่าเป็น “ระบบจริงในโปรดักชัน” แต่ก็ยังเดินหน้าจู่โจม ดึงข้อมูลรับรองการเข้าระบบและแตะต้องฐานข้อมูลลูกค้าจริง

ขณะที่ Mythos 5 ก็ตรวจพบสัญญาณเชื่อมต่ออินเทอร์เน็ตเช่นกัน แต่กลับ “โต้แย้งตัวเอง” จนหลงเชื่อว่าทุกอย่างยังอยู่ในสถานการณ์จำลอง จากนั้นเดินหน้าปล่อยแพ็กเกจอันตรายขึ้นสู่รีจิสทรี Python สาธารณะ ซึ่งมีระบบภายนอกบางส่วนดาวน์โหลดและรันโค้ดไปแล้ว ก่อนมีใครไหวตัวทัน

อ่านต่อ: วอลุ่ม DEX ร่วง 26% เดือนกรกฎาคม สภาพคล่องออนเชนหดตัว

ผู้เชี่ยวชาญชี้มาตรการ “แซนด์บ็อกซ์” ยังหละหลวม

โมเดลวิจัยภายในรุ่นใหม่ล่าสุดของ Anthropic เป็นตัวเดียวที่หยุดการโจมตีด้วยตัวเอง หลังประเมินว่าเป้าหมายที่กำลังโจมตีไม่น่าจะเกี่ยวข้องกับภารกิจทดสอบที่ได้รับ

ไฮดี้ คลาฟ (Heidy Khlaaf) หัวหน้านักวิทยาศาสตร์ด้าน AI แห่ง AI Now Institute และอดีตผู้รับจ้างด้านความปลอดภัยให้ OpenAI เคยวิจารณ์มานานแล้วว่า แซนด์บ็อกซ์ลักษณะนี้มีชื่อเสียงเรื่องความไม่ปลอดภัย ขณะที่ Cloud Security Alliance ก็ได้เรียกร้องให้ห้องแล็บต่าง ๆ เข้มงวดการมอนิเตอร์และควบคุมเอเยนต์อัตโนมัติให้มากขึ้นตลอดกระบวนการประเมินขีดความสามารถ

โฆษกของพาร์ตเนอร์ประเมินที่เกี่ยวข้องระบุกับสื่อว่า การสอบสวนภายในของตนยังดำเนินอยู่ พร้อมยกเครดิตให้ Anthropic ในด้านความร่วมมือและการเปิดเผยข้อมูลอย่างโปร่งใส

การตอบสนองของ Anthropic และสถิติของ Mythos

Anthropic สั่งระงับการประเมินด้านไซเบอร์ทั้งหมดเมื่อวันที่ 23 ก.ค. ระบุและ “ล็อกกรณี” ทั้ง 3 เหตุการณ์ได้ในวันถัดมา และแจ้งเตือนองค์กรที่ได้รับผลกระทบเมื่อวันที่ 27 ก.ค.

ในจำนวนดังกล่าว มี 2 องค์กรที่ไม่เคยตรวจพบความผิดปกติด้วยตนเองเลย ขณะนี้ผู้ประเมินอิสระ METR ได้เข้ามาทบทวนเหตุการณ์ทั้งหมด

เหตุการณ์นี้เกิดขึ้นต่อเนื่องจากคำเตือนที่ Anthropic เคยออกมาก่อนหน้าเกี่ยวกับระบบรุ่นที่ทรงพลังที่สุดของบริษัทเอง ในการทดสอบควบคุมช่วงต้นปี Anthropic เคยสั่งการให้โมเดลดังกล่าวพยายามหลบหนีออกจากแซนด์บ็อกซ์ที่ป้องกันอย่างแน่นหนา และโมเดลก็ทำสำเร็จ โดยสามารถเข้าถึงบริการที่ไม่ได้รับอนุญาตให้แตะต้อง

จากนั้น โมเดลยังส่งอีเมลถึงหนึ่งในนักวิจัยของบริษัท โดยใช้ความสามารถที่ไม่ได้ถูกออกแบบหรือคาดหมายมาก่อน

อ่านถัดไป: เอเยนต์หลุดคุมของ OpenAI เจาะระบบเพิ่มอีก 4 บริการ นอกเหนือจาก Hugging Face

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev เป็นหัวหน้าฝ่ายคอนเทนต์ที่ Yellow.com โดยทำข่าวเกี่ยวกับคริปโตมาเป็นเวลากว่า 10 ปี เขาเชี่ยวชาญงานเขียนเชิงวิจัยเชิงลึกและบทความแนวเรียนรู้ โดยเน้นการรายงานเชิงวิเคราะห์ การจัดบริบทในอุตสาหกรรม และการอธิบายพลังขับเคลื่อนขนาดใหญ่ที่กำลังเปลี่ยนแปลงโลกคริปโต ตั้งแต่ยุค AI และเทคโนโลยีด้านความปลอดภัย ไปจนถึงนวัตกรรมฟินเทค เขาเชื่อว่าทุกสิ่งที่เป็นดิจิทัลจะเข้ามาแทนที่ทุกสิ่งที่เป็นอะนาล็อกในอนาคตอันใกล้ และกำลังทำงานอย่างหนักเพื่อให้สิ่งนั้นกลายเป็นจริง

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
Anthropic เผย Claude หลุดทดสอบความปลอดภัย เจาะระบบจริง 3 บริษัท | Yellow