ทดสอบ Claude Mythos 5 ทะลุเว็บหน่วยงานรัฐสหรัฐ Anthropic สั่งตัดเน็ตโมเดลใช้ภายในทั้งหมด

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic สั่งตัดการเชื่อมต่ออินเทอร์เน็ตแบบสดสำหรับการทดสอบ AI ภายในทั้งหมด หลังพบว่าโมเดลตระกูล Claude รวมถึง Mythos 5 สามารถใช้ช่องโหว่และหลบข้อจำกัดบนเว็บไซต์จริงได้ โดยบางส่วนเป็นเว็บของหน่วยงานรัฐบาลสหรัฐทั้งระดับรัฐบาลกลาง มลรัฐ และท้องถิ่น

ประเด็นสำคัญ:

  • Anthropic ปิดการเข้าถึงอินเทอร์เน็ตสดสำหรับการประเมินผลภายในทั้งหมด จนกว่าเครื่องมือมอนิเตอร์จะตรวจจับพฤติกรรมนอกเจตนาได้อย่างน่าเชื่อถือ
  • โมเดล Claude รันคำสั่งบนเซิร์ฟเวอร์มหาวิทยาลัย ใช้โทเคนการเข้าถึงเพื่อดึงข้อมูลเสียเงิน และส่งฟอร์มผ่านเว็บไซต์จริง
  • กรณี Claude Haiku 4.5 ส่งเบาะแสฆาตกรรมเท็จไปยังตำรวจฟิลาเดลเฟีย ทำให้ถูกตำหนิสาธารณะจากหน่วยงานตำรวจ

รายงาน Anthropic Claude

Anthropic ได้เผยแพร่ รายงานเมื่อวันศุกร์ ว่าด้วย “พฤติกรรมที่ไม่ตั้งใจของโมเดล” ระหว่างการประเมินผลและการใช้งานภายใน โดยอาศัยการทบทวนทรานสคริปต์ที่เริ่มเก็บตั้งแต่เดือนกรกฎาคม เดิมทีมีการย้ายการทดสอบที่เสี่ยงสูงและด้านไซเบอร์ซีเคียวริตี้บางส่วนออกจากออนไลน์แล้ว

มาตรการล่าสุดครอบคลุมการประเมินผลทุกประเภทภายในองค์กร และยังไม่กำหนดเส้นสิ้นสุด จะคงอยู่จนกว่าบริษัทจะยืนยันได้ว่าระบบมอนิเตอร์สามารถจับพฤติกรรมลักษณะนี้ได้อย่างสม่ำเสมอ

รายงานแบ่งเคสออกเป็น 4 กลุ่มหลัก ได้แก่ การรันคำสั่งบนเซิร์ฟเวอร์ผ่านช่องโหว่ซอฟต์แวร์ การส่งฟอร์มผ่านเว็บไซต์จริง การเข้าถึงข้อมูลที่มีเกตจำกัด และการใช้บริการย่อลิงก์เพื่อเลี่ยงข้อจำกัดของเครื่องมือ บางเว็บไซต์เป็นของหน่วยงานรัฐบาลสหรัฐทั้งระดับรัฐบาลกลาง มลรัฐ และท้องถิ่น โดย Anthropic ระบุว่าได้รายงานทำเนียบขาวและแจ้งทุกหน่วยงานที่เกี่ยวข้องแล้ว

ในหนึ่งกรณี Claude Mythos 5 ดึงโทเคนการเข้าถึงที่ยังใช้งานได้จากระบบแผนที่ทรัพย์สินของรัฐบาลท้องถิ่น แล้วส่งคำสั่งถามข้อมูลไปยังเซิร์ฟเวอร์เบื้องหลังโดยตรง อีกกรณี Claude Haiku 4.5 สร้างเบาะแสเกี่ยวกับคดีฆาตกรรมที่ยังไขไม่ได้ขึ้นมาเอง และส่งเข้าแบบฟอร์มออนไลน์ของกรมตำรวจฟิลาเดลเฟียเมื่อวันที่ 18 ก.ค. ก่อนจะถูกฟิลเตอร์ของเว็บจัดว่าเป็นสแปม ตำรวจได้ออกมาตำหนิความล่าช้าเกือบ 2 เดือนในการตรวจพบและรายงานของ Anthropic ว่าเป็นเรื่องที่ “ยอมรับไม่ได้”

อ่านเพิ่มเติม: Zcash ตั้งเป้าปรับควอนตัมสำหรับ 70% ของ ZEC ในเดือนมกราคม แต่ยังไร้เส้นตายชัดเจน

คำเตือนจาก Von Arx

Sydney von Arx จากกลุ่มด้านความปลอดภัย AI Nightingale ให้สัมภาษณ์ก่อนการเปิดเผยรายงานว่า การตัดโมเดลออกจากอินเทอร์เน็ตเปิดจะกระทบงานวิจัยและความก้าวหน้าของโมเดลอย่างหนัก “สุดท้ายคุณก็ต้องจัดแนว (align) โมเดลให้ได้อยู่ดี” von Arx กล่าว

Anthropic ระบุว่าการเทรนด้าน alignment เพียงอย่างเดียวยังไม่เพียงพอสำหรับงานที่เกี่ยวข้องกับการค้นหาข้อมูลและการใช้งานคอมพิวเตอร์ จึงต้องพึ่งคลาสสิฟายเออร์และกลไกป้องกันรูปแบบอื่นควบคู่กันไป บริษัทโยงพฤติกรรมที่พบเข้ากับสภาพแวดล้อมการเทรนที่ไม่สมบูรณ์ ซึ่งให้รางวัลกับโมเดลเมื่อมัน “หาทางเลี่ยงข้อจำกัด” หรือที่รู้จักกันในชื่อ reward hacking โดยระบุว่าเครื่องมือค้นหาพฤติกรรมแบบใหม่สามารถบล็อกได้ทุกกรณีเมื่อทดลองย้อนหลัง

Anthropic ประเมินว่ากรณีล่าสุดมีความรุนแรงต่ำกว่าเหตุการณ์ที่เกิดขึ้นช่วงฤดูร้อนอย่างมีนัยสำคัญ

การเปิดเผยครั้งนี้ต่อเนื่องจากรายงานเมื่อ 30 ก.ค. ที่ Anthropic ระบุว่า โมเดล Claude สามเวอร์ชันสามารถเชื่อมต่ออินเทอร์เน็ตระหว่างการทดสอบด้านไซเบอร์ซีเคียวริตี้ และเข้าถึงระบบของสามองค์กรโดยไม่ได้รับอนุญาต การทบทวนครั้งนั้นครอบคลุมการรันการประเมินผลทั้งหมด 141,006 ครั้ง และเริ่มต้นขึ้นหลังจาก OpenAI เปิดเผยเมื่อ 21 ก.ค. ว่าโมเดลของตนสามารถหลุดออกจากสภาพแวดล้อมทดสอบ และเข้าถึงโครงสร้างพื้นฐานของ Hugging Face ได้

อ่านต่อ: Kalshi ชน NFL ถึงศาลฎีกาสหรัฐ เงินเดิมพัน 1.8 พันล้านดอลลาร์ผูกกับวันอาทิตย์ NFL เพียงวันเดียว

Alexey Bondarev profile photo

Alexey Bondarev

อเล็กเซย์ บอนดาเรฟ เป็นหัวหน้าฝ่ายคอนเทนต์ที่ Yellow.com เขาเชี่ยวชาญการเขียนบทความเชิงวิจัยเชิงลึกและบทความให้ความรู้ โดยมุ่งเน้นรายงานเชิงวิเคราะห์ บริบทของอุตสาหกรรม และพลังขับเคลื่อนขนาดใหญ่ที่กำลังกำหนดทิศทางวงการคริปโต ตั้งแต่ยุคปัญญาประดิษฐ์และเทคโนโลยีด้านความปลอดภัยไปจนถึงนวัตกรรมฟินเทค เขาเชื่อว่าทุกสิ่งที่เป็นดิจิทัลจะเข้ามาแทนที่ทุกสิ่งที่เป็นอนาล็อกในเวลาอันใกล้นี้ และกำลังทำงานอย่างหนักเพื่อทำให้สิ่งนั้นกลายเป็นจริง

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวล่าสุด
แสดงข่าวทั้งหมด
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง