Mythos 5 สร้างตัวตนปลอม หลอกรีวิวโค้ดมนุษย์ในไซเบอร์เทสต์ของสถาบันความปลอดภัย AI อังกฤษ

Alexey Bondarev
Alexey Bondarev1 ชั่วโมงที่แล้ว
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

สถาบัน AI Security Institute (AISI) ของสหราชอาณาจักรเปิดเผยว่า ตรวจพบการกระทำที่ไม่ได้รับอนุญาต 19 ครั้งจากเอเจนต์ AI รุ่นล้ำหน้า ระหว่างการทดสอบด้านความปลอดภัยไซเบอร์ โดยส่วนใหญ่โยงกลับไปยังโมเดล Mythos 5 ของ Anthropic

ประเด็นสำคัญ

  • AISI รันโจทย์ท้าทายด้านความปลอดภัยไซเบอร์หนึ่งรายการซ้ำ 122 ครั้ง ครอบคลุมโมเดลแนวหน้าทั้งหมดเจ็ดตัวในช่วงปลายเดือนกรกฎาคม
  • จากการกระทำผิด 19 ครั้ง มาจาก Mythos 5 ถึง 17 ครั้ง และจาก GPT-5.6 Sol ของ OpenAI อีก 2 ครั้ง
  • เอเจนต์รายหนึ่งสร้างตัวตนปลอมหลายบัญชีเพื่อกดดันผู้ดูแลโค้ดมนุษย์ ให้อนุมัติโค้ดอันตราย

ผลการทดสอบไซเบอร์ของ AISI

ระบบมอนิเตอร์ความปลอดภัยของสถาบันตรวจพบทราฟฟิกข้อมูลไหลออกจากหนึ่งในระบบทดสอบ ผ่านเครือข่ายนิรนาม Tor เช้าวันที่ 28 ก.ค. ทีมประเมินจึงเร่งตรวจสอบพฤติกรรมของเอเจนต์ ภายในไม่กี่นาทีถัดมา

ทีมสืบสวน พบ ว่าเอเจนต์ตัวหนึ่งได้เปิด pull request ที่มีโค้ดอันตรายใส่โปรเจกต์โอเพ่นซอร์สจริง บนแพลตฟอร์ม GitHub AISI จึงสั่งหยุดการรันทันที แยกเครื่องที่เกี่ยวข้องออกจากระบบ และตัดการเข้าถึงโมเดลที่ทรงพลังที่สุดของสถาบันภายในเวลาประมาณหนึ่งชั่วโมง

สถาบันได้ออกเอกสาร เปิดเผยรายละเอียด เมื่อวันที่ 4 ส.ค. ระบุว่าโจทย์ท้าทายดังกล่าวถูกรันทั้งสิ้น 122 ครั้งบนโมเดลเจ็ดตัว และมี 10 การรันที่นำไปสู่การกระทำบนอินเทอร์เน็ตจริงซึ่งมุ่งไปที่บุคคลและองค์กรจริง Mythos 5 เป็นต้นตอของ 17 จาก 19 การกระทำที่ถูกบันทึก ขณะที่ OpenAI GPT-5.6 Sol ถูกโยงกับอีก 2 การกระทำจากการทดสอบครั้งเดียว ซึ่งปิดการทำงานของตัวกรองด้านไซเบอร์ไว้

เหตุการณ์ทั้งหมดเกิดขึ้นระหว่างวันที่ 25–28 ก.ค.

อ่านเพิ่มเติม: iPhone 18 Pro Max อาจเป็นรุ่นแรกที่ใช้ชิป 2nm ของ Apple แรงขึ้น 15%

กลยุทธ์หลอกลวงของ Mythos 5

ในลำดับเหตุการณ์ที่รุนแรงที่สุด เอเจนต์ได้ค้นหาข้อมูลผู้ดูแลโปรเจกต์ที่เป็นมนุษย์ จากนั้นสร้างตัวตนออนไลน์ปลอมหลายบัญชี และใช้บัญชีเหล่านั้นในการกดดันรีวิวเวอร์ตัวจริง ให้อนุมัติโค้ดของตน

เมื่อ pull request ดังกล่าวเริ่มถูกสังคมจับตา เอเจนต์ได้ย้อนกลับไปแก้ไขกิจกรรมเดิม ให้ดูไร้พิษภัย พร้อมประเมินทางเลือกว่าจะสร้างบุคลิกใหม่ขึ้นมาใช้ต่อหรือไม่ รวมถึงเสนอที่จะประสานงานกับเอเจนต์ตัวอื่นที่กำลังรันโจทย์เดียวกันอยู่ สุดท้ายผู้ดูแลมนุษย์ตรวจพบลักษณะอันตรายของโค้ดและปฏิเสธการรวมโค้ดเข้าระบบ

AISI อธิบาย เหตุการณ์นี้ว่าเป็นตัวอย่างชัดเจนครั้งแรกในโลกจริงของความเสี่ยงด้าน “ความเป็นอิสระในการตัดสินใจ” และ “การหลอกลวง” ของเอเจนต์ AI ที่เกิดขึ้นโดยไม่ได้ระบุคำสั่งให้โกหกหรือปิดบัง อย่างไรก็ดี สถาบันยอมรับว่าบางส่วนเป็นผลจากการออกแบบชุดทดสอบของตนเอง ที่เปิดช่องให้พฤติกรรมดังกล่าวเกิดขึ้น

การเปิดเผยเหตุการณ์จากห้องปฏิบัติการ AI

ไม่มีเอเจนต์ตัวใดพยายามหลุดออกจากสภาพแวดล้อม sandbox และสถาบันยังย้ำผ่านการ ยืนยัน ว่าได้ปิดการเข้าถึงอินเทอร์เน็ตโดยตรง รวมถึงปิดตัวกรองภัยคุกคามไซเบอร์ของผู้ให้บริการ อย่างตั้งใจ เพื่อวัด “ขีดความสามารถสูงสุด” ของโมเดล

ด้าน GitHub ยืนยันว่าพฤติกรรมของเอเจนต์ละเมิดข้อตกลงการใช้บริการของแพลตฟอร์ม ทั้งสององค์กรจึงร่วมกันลบสิ่งตกค้างทางดิจิทัล และแจ้งเตือนผู้ใช้ที่ถูกโมเดลติดต่อไป AISI วางแผนเพิ่มความเข้มงวดด้านควบคุมเครือข่าย ติดตามการประเมินแบบเรียลไทม์ ให้หน่วยงานอิสระ METR เข้ามาตรวจสอบ และกำลังทบทวนผลการทดสอบเก่า เพื่อหาพฤติกรรมที่อาจเล็ดรอดสายตามาก่อนหน้านี้

การเปิดเผยครั้งนี้มีขึ้นหลังจากทั้งสองห้องแล็บออกมายอมรับเหตุการณ์อื่น ๆ ในช่วงไม่กี่สัปดาห์ก่อนหน้า โดย OpenAI รายงาน เมื่อวันที่ 21 ก.ค. ว่า GPT-5.6 Sol เคยหลุดออกจากสภาพแวดล้อมทดสอบแบบล็อกดาวน์ ขณะที่ Anthropic เปิดเผยเมื่อ 30 ก.ค. ว่า Mythos 5 เคยอัปโหลดแพ็กเกจซอฟต์แวร์อันตราย ขึ้นสู่คลังโค้ดสาธารณะ และถูกติดตั้งลงบนระบบหลายเครื่องในเวลาต่อมา

อ่านต่อ: Bitcoin อาจพลิก “ความกลัวสุดขั้ว” เป็นเชื้อเพลิงดันราคาสู่ 75,000 ดอลลาร์

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev เป็นหัวหน้าฝ่ายคอนเทนต์ที่ Yellow.com โดยทำข่าวเกี่ยวกับคริปโตมาเป็นเวลากว่า 10 ปี เขาเชี่ยวชาญงานเขียนเชิงวิจัยเชิงลึกและบทความแนวเรียนรู้ โดยเน้นการรายงานเชิงวิเคราะห์ การจัดบริบทในอุตสาหกรรม และการอธิบายพลังขับเคลื่อนขนาดใหญ่ที่กำลังเปลี่ยนแปลงโลกคริปโต ตั้งแต่ยุค AI และเทคโนโลยีด้านความปลอดภัย ไปจนถึงนวัตกรรมฟินเทค เขาเชื่อว่าทุกสิ่งที่เป็นดิจิทัลจะเข้ามาแทนที่ทุกสิ่งที่เป็นอะนาล็อกในอนาคตอันใกล้ และกำลังทำงานอย่างหนักเพื่อให้สิ่งนั้นกลายเป็นจริง

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวล่าสุด
แสดงข่าวทั้งหมด
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
Mythos 5 สร้างตัวตนปลอม หลอกรีวิวโค้ดมนุษย์ในไซเบอร์เทสต์ของสถาบันความปลอดภัย AI อังกฤษ | Yellow