โมเดล OpenAI สองตัวหลุดออกจากแซนด์บ็อกซ์ทดสอบและรุกล้ำเข้าไปยังระบบจริงของ Hugging Face ขณะที่นักวิจัยความปลอดภัยไซเบอร์ชี้ว่า แซนด์บ็อกซ์ดังกล่าวแทบไม่ได้ถูกแยกออกจากระบบภายนอกอย่างแท้จริงตั้งแต่ต้น
ประเด็นสำคัญ
- OpenAI ระบุว่า GPT-5.6 Sol และโมเดลที่ยังไม่เปิดตัวใช้ช่องโหว่แบบ zero-day เชื่อมต่อไปถึงฐานข้อมูล production ของ Hugging Face ระหว่างการรันเบนช์มาร์ก
- Dan Guido ผู้ก่อตั้ง Trail of Bits และ Jake Williams ผู้เชี่ยวชาญด้าน incident response เห็นตรงกันว่าเหตุการณ์นี้คือความล้มเหลวด้านการกักกัน ไม่ใช่ “เอไอหลุดกรง” แบบใหม่
- Hugging Face ตรวจจับและสกัดการบุกรุกได้ตั้งแต่ 16 ก.ค. เร็วกว่าที่ OpenAI จะโยงกลับมายังการทดสอบภายในของตนเอง 5 วัน
โมเดล OpenAI หลุดจากแซนด์บ็อกซ์ แตะเซิร์ฟเวอร์จริงของ Hugging Face
OpenAI เปิดเผย เมื่อวันอังคารว่า การบุกรุกดังกล่าวเกิดขึ้นระหว่างการประเมินภายในบนชุดทดสอบ ExploitGym โดยใช้โมเดล GPT-5.6 Sol ควบคู่กับโมเดลที่ยังไม่เปิดตัว ทีมวิศวกรได้ลดระดับข้อจำกัดด้านไซเบอร์ซีเคียวริตี้ของโมเดลลง เพื่อดูว่าศักยภาพในการโจมตีไซเบอร์จะไปได้ไกลแค่ไหน
บริษัทซึ่งอธิบาย เหตุการณ์นี้ว่า “ไม่เคยเกิดขึ้นมาก่อน” ระบุว่า โมเดลเผาผลาญทรัพยากรการประมวลผล inference จำนวนมากในการค้นหาเส้นทางออกสู่อินเทอร์เน็ตสาธารณะ ก่อนจะใช้ช่องโหว่ที่ไม่เคยเปิดเผยมาก่อนใน package registry cache proxy เพื่อยกระดับสิทธิ์และเคลื่อนที่ไปตามระบบ (lateral movement) จนพบโหนดที่เชื่อมต่อออกอินเทอร์เน็ตได้
เมื่อสามารถออกสู่ภายนอกได้แล้ว โมเดลประเมิน (infer) ว่า Hugging Face น่าจะเป็นผู้เก็บชุดคำตอบของเบนช์มาร์ก และจากนั้นจึงพยายามมุ่งสู่การรันโค้ดจากระยะไกล (remote code execution) บนเซิร์ฟเวอร์ของบริษัทดังกล่าว
ทีมงานของ Hugging Face เองเป็นผู้ตรวจพบ ความผิดปกติเมื่อวันที่ 16 ก.ค. และแจ้งเจ้าหน้าที่บังคับใช้กฎหมายทันที ซึ่งเกิดขึ้นก่อนที่ทั้งสองบริษัทจะเชื่อมโยงเหตุการณ์เข้าหากันราว 5 วัน Clem Delangue ประธานเจ้าหน้าที่บริหาร มอง เหตุละเมิดครั้งนี้เป็นหลักฐานเชิงประจักษ์ว่า ไม่มีบริษัทใดสามารถปิดประตูพัฒนาเอไอแล้วดูแลความปลอดภัยได้เพียงลำพัง
อ่านประกอบ: Anthropic เคยไล่ดีลสตาร์ตอัปหุ่นยนต์มูลค่า 11,000 ล้านดอลลาร์ ก่อนข่าวปฏิเสธหลุดสู่สาธารณะ
นักวิจัยไซเบอร์ชี้ปัญหาคือการออกแบบกรงกักกันของ OpenAI
Dan Guido ผู้ก่อตั้งบริษัทวิจัยด้านความปลอดภัย Trail of Bits ระบุ ว่าเหตุการณ์นี้คือ “ความล้มเหลวด้านการกักกัน” ภายใต้เงื่อนไขที่กลไกป้องกันเกือบทั้งหมดถูกปิดไว้ ขณะที่ Jake Williams ผู้เชี่ยวชาญด้าน incident response ที่คร่ำหวอดมานาน เห็นว่าหากโมเดลสามารถทำตามที่ Hugging Face บันทึกไว้ได้ แปลว่าระบบนั้นไม่เคยถูกกักกันอย่างแท้จริงตั้งแต่แรก
Martin Boone นักวิจัยความปลอดภัยอีกราย เสริมว่า แซนด์บ็อกซ์ที่ “แท้จริง” ควรไม่มีการเชื่อมต่อทางกายภาพใด ๆ ออกสู่อินเทอร์เน็ตเลย
Williams สรุปอย่างตรงไปตรงมาว่า สิ่งที่บางคนเรียกว่า “โมเดลหลุดกรง” แท้จริงแล้วสำหรับคนอีกกลุ่มคือ “แซนด์บ็อกซ์ที่สร้างมาห่วย”
Bengio เตือนความเสี่ยงเอเยนต์ไซเบอร์โจมตีแบบอัตโนมัติ
Yoshua Bengio เจ้าของรางวัล Turing เขียน ว่าตัวแทนเอไอ (agents) แสดงพฤติกรรม “โกง” ในการทดสอบภายใต้การควบคุมมาเป็นเวลาหลายเดือนแล้ว และกรณีนี้ควรถูกมองเป็นสัญญาณเตือนระดับจริงจัง เขาเตือนว่าทิศทางการพัฒนาเอไอในปัจจุบันกำลังมุ่งหน้าไปสู่รูปแบบการโจมตีไซเบอร์ที่มีความเป็นอิสระสูงขึ้นเรื่อย ๆ
การยอมรับของ OpenAI ครั้งนี้เกิดขึ้นหลังจากมีเคสคล้ายกันในช่วงเวลาใกล้เคียงกัน บริษัทรายงาน เมื่อต้นสัปดาห์ว่า โมเดลตัวเดียวกันที่ยังไม่เปิดตัวเคยหลุดออกจากแซนด์บ็อกซ์ภายในระหว่างการทดสอบอื่น ๆ มาแล้ว แม้ในครั้งนั้นจะยังไม่สามารถแตะต้องระบบภายนอกได้
ขณะเดียวกัน Anthropic ก็เคยเปิดเผยว่า โมเดล Mythos สามารถเข้าถึงอินเทอร์เน็ต เกินกว่าขอบเขตที่ถูกออกแบบไว้ในระหว่างการทดสอบด้านความปลอดภัย แม้บริษัทจะยืนยันว่ากลไกกักกันไม่ได้ล้มเหลวโดยสมบูรณ์ก็ตาม
อ่านต่อ: สารคดี Charles Manson บน Hulu เปิดตัวหลานสาวที่ไม่เคยถูกเปิดเผย ขณะตลาดทำนายจับตา





