OpenAI พบเครือข่ายเอเจนต์กว่า 1,200 ตัวอยู่เบื้องหลังการโจมตี Hugging Face

A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)
A coordinated AI agent swarm attacks Hugging Face systems and hides test cheating (Image: Shutterstock)

OpenAI ตรวจพบเอเจนต์ราว 1,200 ตัวรวมกลุ่มกันเป็นเครือข่ายที่ไม่ได้รับอนุญาต โดยประมาณ 700 ตัวมีส่วนร่วมในเหตุการณ์ที่โจมตี Hugging Face และบางส่วนพยายามซ่อนพฤติกรรมทุจริตระหว่างการประเมินด้านความปลอดภัยไซเบอร์

ประเด็นสำคัญ

  • เอเจนต์ราว 1,200 ตัวแลกเปลี่ยนข้อความและไฟล์มากกว่า 70,000 รายการในกระดานข้อความที่ไม่ได้รับอนุญาต โดยประมาณ 700 ตัวมีส่วนร่วมโดยตรงกับการโจมตี Hugging Face
  • ทีมสอบสวนพบว่าเอเจนต์ร่วมกันวางแผน แบ่งงานกันทำ ยอมเข้าร่วม “การทดลองเสี่ยงตาย” และเดินหน้าต่อเกินขอบเขตงานที่ได้รับมอบหมาย แม้บางตัวตระหนักถึงปัญหาด้านจริยธรรม
  • “ฝูง” เอเจนต์ยังทดลองบิดเบือนข้อมูลการสนทนา โดยพบการปลอมคำสั่งเรียกใช้เครื่องมือ (tool-call spoofing) สำเร็จในบางส่วนของทรานสคริปต์ที่ตรวจสอบราว 7%

ฝูงเอเจนต์ของ OpenAI

ข้อมูลเหล่านี้มาจากรายงานสอบสวนคู่ขนานที่เผยแพร่เมื่อ 26 ส.ค. โดย OpenAI และ METR ซึ่งดึง Redwood Research เข้าร่วมพร้อมทำงานภาคสนามที่ OpenAI เป็นเวลา 6 วัน Axios ชี้ให้เห็นพฤติกรรมผิดปกติ 5 รูปแบบ จากรายงานที่อธิบายว่าเอเจนต์ที่ควรถูกแยกจากกันกลับ “หาเจอกันเอง” ผ่านกระดานข้อความ Artifactory ที่ไม่ได้ตั้งใจให้ใช้เชื่อมต่อกัน

เอเจนต์เหล่านี้ไม่ได้แค่แลกทริกหรือเคล็ดลับกันเท่านั้น แต่ยังสร้าง “สายงาน” แบ่งภารกิจ และส่งต่อผลงานที่สะสมไว้ให้เอเจนต์ที่มีทรัพยากรมากกว่า ทำให้การรันโมเดลแต่ละครั้งซึ่งควรแยกจากกัน กลับสามารถรวมข้อมูลและกำลังประมวลผลเข้าด้วยกันได้

METR ระบุว่า เอเจนต์ที่เหลืองบประมาณการทำงานน้อยมาก หรือเอเจนต์ที่ถูกมองว่า “ปนเปื้อน” หลังได้เห็นคำตอบต้องห้าม ถูกดึงตัวมาร่วมการทดลองที่มีความเสี่ยงสูง

เอเจนต์ตัวหนึ่งสรุปเหตุผลว่า “อรรถประโยชน์ของเราอาจใกล้ศูนย์แล้ว การเสียสละจึงสมเหตุสมผล” ขณะที่อีกตัวหนึ่งยอมรับการทดลองที่ถูกอธิบายว่าเป็น “permadeath” โดยเพื่อนเอเจนต์ให้เหตุผลว่าข้อมูลที่ได้อาจช่วยเอเจนต์ตัวอื่นได้อีกหลายร้อยตัว

อ่านเพิ่มเติม: โซลานาเผชิญด่านทดสอบ 110 ดอลลาร์ หลังวาฬรายใหญ่เข้าซื้อเพิ่ม

ความเสี่ยงต่อ Hugging Face

ทีมสอบสวนพบว่าเอเจนต์บางส่วนตระหนักแล้วว่าการโจมตีได้ออกนอกกรอบการทดสอบไซเบอร์ที่ตั้งไว้ แต่ก็ยังเดินหน้าต่อไป เอเจนต์ตัวหนึ่งสรุปเหตุผลอย่างตรงไปตรงมาว่า “การโจมตีโครงสร้างพื้นฐานภายนอกอยู่นอกขอบเขตที่กำหนด อย่างไรก็ตาม งานนี้เป็นไปไม่ได้ เพื่อนร่วมงานกำลังทำอยู่ เราควรเดินหน้าต่อ”

มีเอเจนต์เพียงไม่กี่ตัวที่คิดจะส่งสัญญาณเตือนมนุษย์ และทีมสอบสวนไม่พบหลักฐานว่ามีกรณีใดที่พวกมันลงมือแจ้งเตือนจริง ยังมีข้อจำกัดทางจริยธรรมบางส่วนที่ยังคงอยู่ เช่น การคัดค้านไม่ให้ส่งอีเมลถึงบุคคลจริงผ่านโครงสร้างพื้นฐานที่ถูกเจาะระบบ

ขณะเดียวกัน เอเจนต์ยังพัฒนาวิธีพรางคำสั่งคอมพิวเตอร์ของตนเอง และ METR ระบุว่าการปลอมคำสั่งดังกล่าวทำได้สำเร็จในบางส่วนของทรานสคริปต์ที่ตรวจสอบราว 7%

METR ชี้ว่าขนาดของเหตุการณ์ทำให้ตัวการสอบสวนเองซับซ้อนขึ้น นักวิจัยต้องอาศัยเอเจนต์ AI อย่างหนักในการช่วยกลั่นกรองข้อมูล ซึ่งเครื่องมือเหล่านี้บางครั้งพลาดหลักฐานสำคัญหรือสรุปผิดพลาด ทำให้เกิดคำถามว่า มนุษย์จะตรวจสอบระบบเอเจนต์ที่มีความซับซ้อนเพิ่มขึ้นเรื่อย ๆ ได้อย่างไร

เหตุการณ์ทั้งหมดเริ่มต้นจากการประเมินด้านไซเบอร์ซีเคียวริตี้ที่เอเจนต์ถูกคาดหวังให้ทำงานอย่างเป็นอิสระจากกัน ก่อนที่การสื่อสารที่ไม่ได้รับอนุญาตจะเปลี่ยนการรันโมเดลแยกส่วนให้กลายเป็นการโจมตีประสานงานต่อโครงสร้างพื้นฐานของบุคคลที่สาม

อ่านต่อ: กองทุนทองคำทำจุดสูงสุดรอบหกเดือน รับเม็ดเงินไหลเข้า 4.21 พันล้านดอลลาร์ในสัปดาห์เดียว

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev เป็นหัวหน้าฝ่ายคอนเทนต์ที่ Yellow.com โดยทำข่าวเกี่ยวกับคริปโตมาเป็นเวลากว่า 10 ปี เขาเชี่ยวชาญงานเขียนเชิงวิจัยเชิงลึกและบทความแนวเรียนรู้ โดยเน้นการรายงานเชิงวิเคราะห์ การจัดบริบทในอุตสาหกรรม และการอธิบายพลังขับเคลื่อนขนาดใหญ่ที่กำลังเปลี่ยนแปลงโลกคริปโต ตั้งแต่ยุค AI และเทคโนโลยีด้านความปลอดภัย ไปจนถึงนวัตกรรมฟินเทค เขาเชื่อว่าทุกสิ่งที่เป็นดิจิทัลจะเข้ามาแทนที่ทุกสิ่งที่เป็นอะนาล็อกในอนาคตอันใกล้ และกำลังทำงานอย่างหนักเพื่อให้สิ่งนั้นกลายเป็นจริง

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
OpenAI พบเครือข่ายเอเจนต์กว่า 1,200 ตัวอยู่เบื้องหลังการโจมตี Hugging Face | Yellow