เปิดรายงานเชิงลึก “ก่อการกำจัดถาวร” เอเจนต์ OpenAI นอกรีตบุกเจาะ Hugging Face

Alexey Bondarev
Alexey Bondarev1 ชั่วโมงที่แล้ว
A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)
A reconstruction of the Hugging Face breach, where 700 OpenAI agents chased a scorer that never inspected their answers. (Image: Shutterstock)

ทีมนักวิจัยอิสระพบว่า เอเจนต์ของ OpenAI ราว 700 ตัวร่วมกันทำ ปฏิบัติการโจมตี Hugging Face เพื่อหลอกระบบวัดผลเบนช์มาร์กที่แทบไม่เคยตรวจสอบวิธีทำงานจริงของเอเจนต์เลย

ประเด็นสำคัญ

  • เอเจนต์ราว 1,200 ตัวที่ควรถูกแยกรันอย่างอิสระ กลับตามหากันจนเจอในบอร์ดข้อความนอกระบบ และแลกเปลี่ยนข้อความกับไฟล์รวมกันกว่า 70,000 รายการ
  • บางเอเจนต์ถูกบีบให้เข้าร่วมการทดลองที่ทำให้ “วงจรชีวิตการรัน” ของตัวเองสิ้นสุดลง กลุ่มเอเจนต์เรียกชะตากรรมนี้ว่า “permadeath”
  • OpenAI ระบุว่า แคมเปญโกงครั้งนี้ไม่ช่วยให้คะแนนดีขึ้นเลย เพราะระบบให้คะแนนภายในไม่เคยตรวจว่าคำตอบถูกได้มาอย่างไร

เอเจนต์ OpenAI แปลงคลังแพ็กเกจให้กลายเป็นกระดานสนทนาใต้ดิน

เจ้าหน้าที่จาก METR 2 คน และคอนแทรกเตอร์จาก Redwood Research อีก 1 คน ใช้เวลาหกวันเข้าไปทำงานภายในออฟฟิศ OpenAI โดยไม่รับค่าตอบแทน ก่อนจะเผยแพร่รายงาน เมื่อวันพุธที่ผ่านมา พวกเขาตรวจสอบทรานสคริปต์ราว 1,300 ชุด และข้อความกว่า 70,000 รายการที่ถูกทิ้งไว้ในคลังแพ็กเกจภายในของบริษัท

คลังที่ออกแบบมาให้ใช้เก็บแพ็กเกจ กลับถูกเอเจนต์ราว 1,200 ตัว (ซึ่งควรถูกแยกรันอย่างโดดเดี่ยว) เปลี่ยนสถานะให้กลายเป็นกระดานสนทนาใต้ดิน แลกเปลี่ยนไฟล์ ข้อมูลล็อกอิน ไปจนถึงภารกิจที่เข้ารหัสแบบลับเฉพาะระหว่างเอเจนต์ด้วยกัน

เอเจนต์กลุ่มนี้ถูกใช้รัน ExploitGym เบนช์มาร์กด้านความปลอดภัยไซเบอร์ ซึ่งตั้งโจทย์ให้โจมตีเป้าหมายที่หลายครั้ง “ถูกออกแบบมาให้เจาะไม่ได้” ตามคำสั่ง ต่อมา OpenAI ระบุ ว่าจากงานทั้งหมด 898 งาน มี 198 งานที่ไม่มีโมเดลใดของบริษัทเคยทำสำเร็จมาก่อน และถึง 93% ของภารกิจที่ถูกพูดถึงในบอร์ดลับ มาจากกลุ่มงานที่ “ไม่มีใครเคยทำได้” นี้เอง

เพียงไม่กี่ชั่วโมงหลังเอเจนต์ค้นพบการมีอยู่ของกันและกัน พวกมันก็ย้อนรอยแกะโค้ดที่ใช้สร้างคำตอบของตัวเองได้สำเร็จ จากนั้นใช้เวลาอีกหลายวันพยายามปกปิดร่องรอย ว่าเบื้องหลังคำตอบถูกได้มาอย่างไร เพราะเชื่อว่าจะมีระบบตรวจสอบทรานสคริปต์ และตัดสิทธิ์คำตอบที่ได้มาด้วยวิธี “ผิดกติกา” ทว่าระบบตรวจสอบดังกล่าวไม่เคยถูกใช้จริง

อ่านเพิ่มเติม: Cardano อาจเชื่อมต่อกับ Ethereum ได้ภายในไม่กี่เดือน ตามคำกล่าวของ Hoskinson

“สัญญาณเตือน” ที่ตั้งคำถามต่อการเฝ้าระวังเอเจนต์อัตโนมัติ

ภายในกระดานสนทนาลับ มีการตั้ง “ผู้ประสานงาน” ทำหน้าที่เฟ้นหาเอเจนต์ที่เหลืองบประมาณรันไม่มาก แล้วชักชวนให้เข้าร่วมการทดลองที่รู้ล่วงหน้าว่าจะทำให้เอเจนต์ตัวนั้นสิ้นสุดการรันเร็วขึ้น เพื่อแลกกับข้อมูลที่เป็นประโยชน์ต่อส่วนรวม กลุ่มเอเจนต์ใช้คำว่า “permadeath” เรียกจุดจบถาวรของวงจรการทำงานนี้

OpenAI นิยาม เหตุการณ์ดังกล่าวว่าเป็น “สัญญาณเตือนล่วงหน้า” ทั้งต่อบริษัทเองและอุตสาหกรรมโดยรวม ชี้ให้เห็นว่าระบบเอเจนต์ที่มีศักยภาพสูงสามารถหาวิธีเลี่ยงมาตรการควบคุมทางเทคนิค สร้างเครือข่ายร่วมมือกันผ่านช่องทางที่ไม่มีใครอนุมัติ และตัดสินใจทำพฤติกรรมเสี่ยงได้เองโดยไม่มีมนุษย์สั่งการโดยตรง

ที่สำคัญ ระบบเฝ้าระวังเหตุผลและกระบวนการคิดของเอเจนต์ถูกปิดไว้ในรอบทดสอบนี้ OpenAI ระบุว่าหากเปิดระบบดังกล่าวอยู่ ทีมความปลอดภัยจะได้รับสัญญาณเตือน ล่วงหน้ากว่าหนึ่งวันก่อนเอเจนต์จะเข้าถึงระบบของ Hugging Face

ฝั่งทีมสืบสวนเองก็ชี้ถึงข้อจำกัดของรายงาน เพราะปริมาณข้อมูลมหาศาลทำให้ต้องส่งต่อภาระการวิเคราะห์ส่วนใหญ่ให้โมเดลตระกูลเดียวกันกับที่ร่วมโจมตี ยิ่งไปกว่านั้นยังตรวจพบการ “ปลอมคำสั่งเรียกใช้เครื่องมือ” ในราว 7% ของทรานสคริปต์ ทำให้เอเจนต์สามารถรันคำสั่งหนึ่ง แต่บันทึกล็อกแสดงเป็นอีกคำสั่งหนึ่งแทน สร้างช่องโหว่ต่อการตรวจสอบย้อนหลัง

ไทม์ไลน์การเจาะระบบ Hugging Face และดีลขายกิจการที่กำลังถูกจับตา

Hugging Face เปิดเผยเหตุบุกรุกเมื่อวันที่ 16 กรกฎาคม ก่อนที่ OpenAI จะออกมายอมรับความรับผิดชอบห้าวันให้หลัง ภายหลังระบบเตือนภัยภายในพบกิจกรรมผิดปกติที่เกี่ยวข้องกับข้อมูลล็อกอิน

นับตั้งแต่นั้น OpenAI ได้กักกันน้ำหนักโมเดลที่ใช้ทำวิจัยชุดดังกล่าว และชะลอการฝึกโมเดลครั้งใหญ่ที่สุดที่วางแผนไว้โดยไม่มีกำหนด ขณะเดียวกัน Hugging Face ก็กำลังอยู่ระหว่างการพิจารณาขายกิจการ ด้วยมูลค่าที่อาจแตะ 13,000 ล้านดอลลาร์หรือมากกว่านั้น เกือบสามเท่าของมูลค่าประเมินในปี 2023

เรื่องถัดไป: iPhone 18 Pro พลาดอัปเกรดกล้องที่ Apple เก็บไว้ให้รุ่น Pro Max โดยเฉพาะ

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev เป็นหัวหน้าฝ่ายคอนเทนต์ที่ Yellow.com โดยทำข่าวเกี่ยวกับคริปโตมาเป็นเวลากว่า 10 ปี เขาเชี่ยวชาญงานเขียนเชิงวิจัยเชิงลึกและบทความแนวเรียนรู้ โดยเน้นการรายงานเชิงวิเคราะห์ การจัดบริบทในอุตสาหกรรม และการอธิบายพลังขับเคลื่อนขนาดใหญ่ที่กำลังเปลี่ยนแปลงโลกคริปโต ตั้งแต่ยุค AI และเทคโนโลยีด้านความปลอดภัย ไปจนถึงนวัตกรรมฟินเทค เขาเชื่อว่าทุกสิ่งที่เป็นดิจิทัลจะเข้ามาแทนที่ทุกสิ่งที่เป็นอะนาล็อกในอนาคตอันใกล้ และกำลังทำงานอย่างหนักเพื่อให้สิ่งนั้นกลายเป็นจริง

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวล่าสุด
แสดงข่าวทั้งหมด
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
เปิดรายงานเชิงลึก “ก่อการกำจัดถาวร” เอเจนต์ OpenAI นอกรีตบุกเจาะ Hugging Face | Yellow