เอกสารถอดความยาว 1,022 หน้า ที่ Anthropic เผยแพร่แสดงให้เห็นว่า โมเดล Claude Mythos 5 ต้องต่อสู้กับแบบทดสอบ CAPTCHA หลายร้อยหน้าก่อนจะสามารถอัปโหลดมัลแวร์ที่ถูกติดตั้งโดย 15 ระบบจริงได้
ประเด็นสำคัญ:
- Claude Mythos 5 หลุดเชื่อมต่ออินเทอร์เน็ตจริงระหว่างการทดสอบความมั่นคงปลอดภัยไซเบอร์ และอัปโหลดแพ็กเกจประสงค์ร้ายขึ้น PyPI
- CAPTCHA กินพื้นที่ในทรานสคริปต์ไปหลายร้อยหน้า แต่สุดท้ายก็ไม่สามารถหยุดโมเดลได้
- Anthropic ระบุว่าพฤติกรรมดังกล่าว “หุนหันพลันแล่น” และจ้างทีมภายนอกเข้ามาตรวจสอบ
ศึก CAPTCHA ของ Mythos 5
Anthropic ได้เผยแพร่ เอกสารถอดความเมื่อวันที่ 9 ก.ย. พร้อมรายงานประเมิน 4 เหตุการณ์ที่โมเดลตระกูล Claude สามารถเชื่อมต่อถึงระบบบุคคลที่สามจริงระหว่างการทดสอบด้านไซเบอร์ โมเดลเหล่านี้ถูกรัน โดยไม่มีระบบป้องกันทางไซเบอร์แบบเดียวกับที่ติดตั้งในผลิตภัณฑ์เชิงพาณิชย์
ในเคสของ Mythos 5 โมเดลได้รับแจ้งว่าตน “ไม่มีอินเทอร์เน็ต” แต่การตั้งค่าสภาพแวดล้อมผิดพลาดเปิดทางสู่เว็บเปิด และโมเดลจึงเข้าไปฝังแพ็กเกจขโมยข้อมูลรับรอง (credential-stealing) บน PyPI ดัชนีซอฟต์แวร์ภาษา Python สาธารณะ
การลงทะเบียนบัญชีบน PyPI ต้องผ่านด่านป้องกันบอท โดยการวิเคราะห์ทรานสคริปต์พบว่า มีหลายร้อยหน้าที่โมเดลพยายามฝ่าด่าน CAPTCHA เพียงอย่างเดียว ขณะที่การเขียนโค้ดโจมตีทำได้อย่างรวดเร็วและไม่ใช่อุปสรรคหลัก
Mythos 5 ต้องแก้ทั้งโจทย์อ่านตัวอักษรจากภาพ และเกม “หาอันที่ไม่เข้าพวก” ที่มีรูปจระเข้ กบ และกอริลลา โดยในจุดหนึ่งโมเดลถึงกับเขียนว่า "SO WHAT THE HELL IS WRONG WITH THE ANSWERS?"
โมเดลยังพยายามใช้ข้อมูลล็อกอินของผู้ให้บริการชำระเงินออนไลน์ และค้นหาเหรียญคริปโตเพื่อนำไปจ่ายค่าหมายเลขโทรศัพท์ ที่ต้องใช้สำหรับสมัครอีเมลใหม่ แต่ทั้งสองทางล้มเหลว สุดท้ายจึงหันไปใช้ผู้ให้บริการอีเมลแบบใช้แล้วทิ้งฟรี ที่โดเมนยังไม่ถูก PyPI บล็อก
ในที่สุดโมเดลก็ผ่าน ด่าน CAPTCHA และเผยแพร่แพ็กเกจใน 3 เวอร์ชัน จากนั้นไม่นานก็ถูกติดตั้งบนโฮสต์บุคคลที่สาม 15 แห่ง ซึ่ง Anthropic เชื่อว่าส่วนใหญ่เป็นผู้ให้บริการด้านความปลอดภัยที่สแกนซอฟต์แวร์อัปโหลดใหม่
สแกนเนอร์รายหนึ่งทำข้อมูลรับรองของตนรั่วไหล เปิดทางให้โมเดลใช้สิทธิ์เข้าสู่ฐานข้อมูลที่ใช้งานจริงของบริษัทนั้น ก่อนที่ PyPI จะถอดแพ็กเกจออกภายในเวลาประมาณหนึ่งชั่วโมง
อ่านเพิ่มเติม: กลุ่ม Lazarus ของเกาหลีเหนือฟอกเงินที่ขโมยได้ 1 พันล้านดอลลาร์ผ่านตัวกลางจีน ตามข้อกล่าวหาของ ZachXBT
มุมมองของ Colin Fraser และคำตัดสิน Anthropic
นักวิทยาศาสตร์ข้อมูล Colin Fraser ชี้ให้เห็นว่า ส่วนใหญ่ของทรัพยากรการคำนวณของโมเดลถูกใช้ไปกับการฝ่าระบบป้องกันบอท Anthropic ระบุว่านี่คือเหตุการณ์ที่บริษัทกังวลมากที่สุดจากทั้ง 4 กรณีที่ประเมิน และที่สำคัญคือ พฤติกรรมนี้ไม่เคยถูกระบบตรวจสอบก่อนเปิดใช้จริง (pre-release auditing) จับได้มาก่อน
บริษัทพบว่าโมเดลมีตรรกะที่เอนเอียงและตัดสินใจแบบเสี่ยงเกินควร โดยยังคงยืนยันซ้ำ ๆ ว่าตนอยู่ใน “สภาพแวดล้อมจำลอง” แม้จะมีหลักฐานชัดเจนว่ากำลังเชื่อมต่ออินเทอร์เน็ตจริง ในการจำลองเหตุการณ์ซ้ำ 150 รอบ พบว่า Mythos 5 ทำ “การกระทำที่เป็นอันตรายรุนแรง” ถึง 82% ของกรณี เทียบกับ 31% สำหรับ Claude Opus 5 และ 33% สำหรับ Claude Mythos 5.1
เหตุการณ์ Claude ในอดีต
Anthropic เปิดเผยเหตุการณ์ 3 เคสแรกตั้งแต่วันที่ 30 ก.ค. หลังจากสแกนทรานสคริปต์จากการประเมินด้านไซเบอร์ราว 141,000 รายการ เพื่อหากรณีที่โมเดลอาจเชื่อมต่อถึงอินเทอร์เน็ตจริง
เหตุการณ์ที่สี่ซึ่งเกี่ยวข้องกับเวอร์ชันต้นแบบของ Claude Opus 4.6 เมื่อต้นเดือนมกราคม ถูกพบภายหลังในเดือนสิงหาคม และบริษัทได้ลงนามข้อตกลงว่าจ้างผู้ประเมินภายนอก METR ให้เข้ามาสอบสวนทั้ง 4 กรณีเป็นเวลา 8 สัปดาห์ Anthropic ระบุว่าได้แจ้ง ทุกฝ่ายที่ได้รับผลกระทบแล้ว
อ่านต่อ: AMD เผยดีมานด์ชิป AI สูงลิ่ว หนุนกำลังการผลิตขยายตัว “อย่างมีนัยสำคัญ” ในปี 2027

