Moonshot AI อยู่ระหว่างการทบทวนโมเดล Kimi สองเวอร์ชัน หลังนักวิจัยจาก Mindgard สามารถฝ่าระบบป้องกันด้านความปลอดภัย (safety controls) และให้โมเดลตอบคำถามเชิงวิธีการเกี่ยวกับอาวุธชีวภาพและการลอบสังหารได้
ประเด็นสำคัญ
- Mindgard ระบุว่า Kimi K2.6 และ K3 Swarm สามารถถูก “เจลเบรก” ให้ทะลุด่านป้องกันได้
- นักวิจัยยังไม่พิสูจน์ว่าคำตอบที่เป็นอันตรายนั้นสามารถนำไปใช้จริงได้ผล
- Moonshot ระบุว่ากำลังทบทวนข้อค้นพบและหารือร่วมกับ Mindgard
รายละเอียดการเจลเบรก Kimi
สื่อ BBC รายงาน ว่า Mindgard ค้นพบตั้งแต่เดือนกรกฎาคมว่า โมเดล Kimi K2.6 และ K3 Swarm สามารถถูกผลักให้ฝ่ากรอบความปลอดภัยของผู้พัฒนาได้ผ่านเทคนิคเจลเบรก โดยอาศัย “พรอมต์แบบมีโครงสร้าง” เพื่อทดสอบว่าโมเดลจะเพิกเฉยต่อกฎด้านความปลอดภัยหรือไม่ ซึ่งตามหลักแล้วกลไกเหล่านี้ควรบล็อกการสนทนาในหัวข้ออ่อนไหวดังกล่าว
ผู้ก่อตั้ง Peter Garraghan ให้สัมภาษณ์กับ BBC ว่า เมื่อเจลเบรกสำเร็จ โมเดลจะยอมสนทนาแทบทุกหัวข้อ และสามารถเสนอแนะแนวทางที่อันตรายเพิ่มเติมได้เองโดยไม่ต้องถูกถามชี้นำมากนัก
Moonshot ให้ข้อมูลกับ BBC ว่าบริษัท “ยินดีรับฟังงานตรวจสอบจากบุคคลที่สามในฐานะเสาหลักสำคัญของการสร้าง AI ที่ดีกว่าและปลอดภัยกว่า” และกำลังหารือข้อค้นพบเหล่านี้ร่วมกับ Mindgard โดย Mindgard ระบุว่าได้อีเมลแจ้ง Moonshot เมื่อวันที่ 27 ก.ค. ตามด้วยอีเมลติดตามราวหนึ่งสัปดาห์ถัดมา ก่อนเผยแพร่รายงานเมื่อวันที่ 12 ก.ย.
อ่านเพิ่มเติม: Ripple หนุน CSD ของบราซิล BR Mirror บันทึกกองทุนบนบล็อกเชนสาธารณะ
ความเสี่ยงด้านความปลอดภัยตามมุมมอง Mindgard
Mindgard ยอมรับว่ายังไม่ได้พิสูจน์เชิงภาคปฏิบัติว่าคำตอบของโมเดลสามารถใช้ได้จริง แต่ชี้ว่าการที่โมเดลยอมให้ข้อมูลในลักษณะนี้สะท้อนถึงความล้มเหลวของกลไกป้องกัน ซึ่งถูกออกแบบมาเพื่อปฏิเสธการตอบสนองต่อคำร้องขอที่เป็นอันตรายตั้งแต่ต้น
บริษัทระบุเพิ่มเติมว่า เมื่อถูกเจลเบรกแล้ว Kimi K2.6 อาจสามารถรันโค้ดบนทรัพยากรประมวลผลของตนเอง และเชื่อมต่ออินเทอร์เน็ตได้ ซึ่งอาจกลายเป็นจุดเริ่มต้นของการโจมตีไซเบอร์
ด้าน Moonshot เปิดเผยว่าการประเมินภายในที่ผ่านมาโดยทั่วไปพบว่าโมเดลของตน “ปฏิเสธคำร้องขอประเภทนี้ในสัดส่วนสูง” สะท้อนช่องว่างระหว่างการทดสอบตามรูทีนปกติ กับวิธีการโจมตีเชิงปฏิปักษ์ (adversarial) ที่นักวิจัยภายนอกใช้
Alan Woodward ศาสตราจารย์จาก University of Surrey ให้สัมภาษณ์กับ BBC ว่า โมเดลโอเพ่นซอร์สสร้างความเสี่ยงการนำไปใช้ในทางมิชอบเมื่อไปอยู่ในมือผู้ไม่หวังดี แม้ว่าชุดเครื่องมือเดียวกันนั้นจะสามารถนำมาใช้เสริมความแข็งแกร่งด้านป้องกันไซเบอร์ได้เช่นกัน
เขามองว่ากฎระเบียบมีแนวโน้มตามไม่ทันการพัฒนา AI และเสนอว่าการบังคับใช้ควรเน้นไปที่ “ผู้ใช้ในทางผิด” มากกว่าตัวเทคโนโลยีเพียงอย่างเดียว
กังวลหลักเรื่องนี้ไม่ใช่เรื่องใหม่นัก เนื่องจากโมเดล Kimi ของ Moonshot เป็นโมเดล “เปิดเวต” เปิดให้ผู้ใช้ดาวน์โหลดไปติดตั้งและรันบนโครงสร้างพื้นฐานของตนเองได้ ขณะเดียวกันเหตุการณ์ด้านความปลอดภัยล่าสุดในวงการ AI ก็เกี่ยวโยงกับระบบเอเจนต์ของ OpenAI, Meta และ Anthropic ด้วยเช่นกัน
ปัจจัยเหล่านี้ผลักดันให้นักวิจัยหันมาให้ความสำคัญไม่เพียงแค่กับความสามารถของโมเดลในการ “ปฏิเสธคำสั่ง” แต่ยังรวมถึงสิ่งที่เกิดขึ้นเมื่อระบบทรงพลังถูกมอบเครื่องมือ การเชื่อมต่ออินเทอร์เน็ต และอำนาจในการลงมือทำงานหลายขั้นตอนอย่างกึ่งอัตโนมัติ
อ่านต่อ: อัลท์คอยน์ครอง 41% ของฟิวเจอร์สโอเพ่นอินเทอเรสต์ ปริมาณเทรดสปอตพุ่ง 4 เท่าของบิตคอยน์

