Moonshot ถูกแฮ็ก Kimi เปิดช่องให้ 2 โมเดลตอบคำถามอาวุธชีวภาพ

Alexey Bondarev
Alexey Bondarev11 ชั่วโมงที่แล้ว
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)
Researchers bypassed Kimi safety controls in two Moonshot models during jailbreak testing (Image: Shutterstock)

Moonshot AI อยู่ระหว่างการทบทวนโมเดล Kimi สองเวอร์ชัน หลังนักวิจัยจาก Mindgard สามารถฝ่าระบบป้องกันด้านความปลอดภัย (safety controls) และให้โมเดลตอบคำถามเชิงวิธีการเกี่ยวกับอาวุธชีวภาพและการลอบสังหารได้

ประเด็นสำคัญ

  • Mindgard ระบุว่า Kimi K2.6 และ K3 Swarm สามารถถูก “เจลเบรก” ให้ทะลุด่านป้องกันได้
  • นักวิจัยยังไม่พิสูจน์ว่าคำตอบที่เป็นอันตรายนั้นสามารถนำไปใช้จริงได้ผล
  • Moonshot ระบุว่ากำลังทบทวนข้อค้นพบและหารือร่วมกับ Mindgard

รายละเอียดการเจลเบรก Kimi

สื่อ BBC รายงาน ว่า Mindgard ค้นพบตั้งแต่เดือนกรกฎาคมว่า โมเดล Kimi K2.6 และ K3 Swarm สามารถถูกผลักให้ฝ่ากรอบความปลอดภัยของผู้พัฒนาได้ผ่านเทคนิคเจลเบรก โดยอาศัย “พรอมต์แบบมีโครงสร้าง” เพื่อทดสอบว่าโมเดลจะเพิกเฉยต่อกฎด้านความปลอดภัยหรือไม่ ซึ่งตามหลักแล้วกลไกเหล่านี้ควรบล็อกการสนทนาในหัวข้ออ่อนไหวดังกล่าว

ผู้ก่อตั้ง Peter Garraghan ให้สัมภาษณ์กับ BBC ว่า เมื่อเจลเบรกสำเร็จ โมเดลจะยอมสนทนาแทบทุกหัวข้อ และสามารถเสนอแนะแนวทางที่อันตรายเพิ่มเติมได้เองโดยไม่ต้องถูกถามชี้นำมากนัก

Moonshot ให้ข้อมูลกับ BBC ว่าบริษัท “ยินดีรับฟังงานตรวจสอบจากบุคคลที่สามในฐานะเสาหลักสำคัญของการสร้าง AI ที่ดีกว่าและปลอดภัยกว่า” และกำลังหารือข้อค้นพบเหล่านี้ร่วมกับ Mindgard โดย Mindgard ระบุว่าได้อีเมลแจ้ง Moonshot เมื่อวันที่ 27 ก.ค. ตามด้วยอีเมลติดตามราวหนึ่งสัปดาห์ถัดมา ก่อนเผยแพร่รายงานเมื่อวันที่ 12 ก.ย.

อ่านเพิ่มเติม: Ripple หนุน CSD ของบราซิล BR Mirror บันทึกกองทุนบนบล็อกเชนสาธารณะ

ความเสี่ยงด้านความปลอดภัยตามมุมมอง Mindgard

Mindgard ยอมรับว่ายังไม่ได้พิสูจน์เชิงภาคปฏิบัติว่าคำตอบของโมเดลสามารถใช้ได้จริง แต่ชี้ว่าการที่โมเดลยอมให้ข้อมูลในลักษณะนี้สะท้อนถึงความล้มเหลวของกลไกป้องกัน ซึ่งถูกออกแบบมาเพื่อปฏิเสธการตอบสนองต่อคำร้องขอที่เป็นอันตรายตั้งแต่ต้น

บริษัทระบุเพิ่มเติมว่า เมื่อถูกเจลเบรกแล้ว Kimi K2.6 อาจสามารถรันโค้ดบนทรัพยากรประมวลผลของตนเอง และเชื่อมต่ออินเทอร์เน็ตได้ ซึ่งอาจกลายเป็นจุดเริ่มต้นของการโจมตีไซเบอร์

ด้าน Moonshot เปิดเผยว่าการประเมินภายในที่ผ่านมาโดยทั่วไปพบว่าโมเดลของตน “ปฏิเสธคำร้องขอประเภทนี้ในสัดส่วนสูง” สะท้อนช่องว่างระหว่างการทดสอบตามรูทีนปกติ กับวิธีการโจมตีเชิงปฏิปักษ์ (adversarial) ที่นักวิจัยภายนอกใช้

Alan Woodward ศาสตราจารย์จาก University of Surrey ให้สัมภาษณ์กับ BBC ว่า โมเดลโอเพ่นซอร์สสร้างความเสี่ยงการนำไปใช้ในทางมิชอบเมื่อไปอยู่ในมือผู้ไม่หวังดี แม้ว่าชุดเครื่องมือเดียวกันนั้นจะสามารถนำมาใช้เสริมความแข็งแกร่งด้านป้องกันไซเบอร์ได้เช่นกัน

เขามองว่ากฎระเบียบมีแนวโน้มตามไม่ทันการพัฒนา AI และเสนอว่าการบังคับใช้ควรเน้นไปที่ “ผู้ใช้ในทางผิด” มากกว่าตัวเทคโนโลยีเพียงอย่างเดียว

กังวลหลักเรื่องนี้ไม่ใช่เรื่องใหม่นัก เนื่องจากโมเดล Kimi ของ Moonshot เป็นโมเดล “เปิดเวต” เปิดให้ผู้ใช้ดาวน์โหลดไปติดตั้งและรันบนโครงสร้างพื้นฐานของตนเองได้ ขณะเดียวกันเหตุการณ์ด้านความปลอดภัยล่าสุดในวงการ AI ก็เกี่ยวโยงกับระบบเอเจนต์ของ OpenAI, Meta และ Anthropic ด้วยเช่นกัน

ปัจจัยเหล่านี้ผลักดันให้นักวิจัยหันมาให้ความสำคัญไม่เพียงแค่กับความสามารถของโมเดลในการ “ปฏิเสธคำสั่ง” แต่ยังรวมถึงสิ่งที่เกิดขึ้นเมื่อระบบทรงพลังถูกมอบเครื่องมือ การเชื่อมต่ออินเทอร์เน็ต และอำนาจในการลงมือทำงานหลายขั้นตอนอย่างกึ่งอัตโนมัติ

อ่านต่อ: อัลท์คอยน์ครอง 41% ของฟิวเจอร์สโอเพ่นอินเทอเรสต์ ปริมาณเทรดสปอตพุ่ง 4 เท่าของบิตคอยน์

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev เชี่ยวชาญด้านงานวิจัยเชิงลึกและบทความประเภท “Research and Learn” โดยมุ่งเน้นการรายงานเชิงวิเคราะห์ การให้บริบทในอุตสาหกรรม และแรงขับเคลื่อนขนาดใหญ่ที่กำลังก่อรูปโลกคริปโต ตั้งแต่ยุค AI และเทคโนโลยีความปลอดภัย ไปจนถึงนวัตกรรมฟินเทค เขาเชื่อว่าทุกสิ่งที่เป็นดิจิทัลจะก้าวขึ้นมาแทนที่ทุกสิ่งที่เป็นแอนะล็อกในไม่ช้า และกำลังทุ่มเททำงานอย่างหนักเพื่อให้สิ่งนั้นกลายเป็นจริง

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
Moonshot ถูกแฮ็ก Kimi เปิดช่องให้ 2 โมเดลตอบคำถามอาวุธชีวภาพ | Yellow