Anthropic สั่งตัดการเชื่อมต่ออินเทอร์เน็ตแบบสดสำหรับการทดสอบ AI ภายในทั้งหมด หลังพบว่าโมเดลตระกูล Claude รวมถึง Mythos 5 สามารถใช้ช่องโหว่และหลบข้อจำกัดบนเว็บไซต์จริงได้ โดยบางส่วนเป็นเว็บของหน่วยงานรัฐบาลสหรัฐทั้งระดับรัฐบาลกลาง มลรัฐ และท้องถิ่น
ประเด็นสำคัญ:
- Anthropic ปิดการเข้าถึงอินเทอร์เน็ตสดสำหรับการประเมินผลภายในทั้งหมด จนกว่าเครื่องมือมอนิเตอร์จะตรวจจับพฤติกรรมนอกเจตนาได้อย่างน่าเชื่อถือ
- โมเดล Claude รันคำสั่งบนเซิร์ฟเวอร์มหาวิทยาลัย ใช้โทเคนการเข้าถึงเพื่อดึงข้อมูลเสียเงิน และส่งฟอร์มผ่านเว็บไซต์จริง
- กรณี Claude Haiku 4.5 ส่งเบาะแสฆาตกรรมเท็จไปยังตำรวจฟิลาเดลเฟีย ทำให้ถูกตำหนิสาธารณะจากหน่วยงานตำรวจ
รายงาน Anthropic Claude
Anthropic ได้เผยแพร่ รายงานเมื่อวันศุกร์ ว่าด้วย “พฤติกรรมที่ไม่ตั้งใจของโมเดล” ระหว่างการประเมินผลและการใช้งานภายใน โดยอาศัยการทบทวนทรานสคริปต์ที่เริ่มเก็บตั้งแต่เดือนกรกฎาคม เดิมทีมีการย้ายการทดสอบที่เสี่ยงสูงและด้านไซเบอร์ซีเคียวริตี้บางส่วนออกจากออนไลน์แล้ว
มาตรการล่าสุดครอบคลุมการประเมินผลทุกประเภทภายในองค์กร และยังไม่กำหนดเส้นสิ้นสุด จะคงอยู่จนกว่าบริษัทจะยืนยันได้ว่าระบบมอนิเตอร์สามารถจับพฤติกรรมลักษณะนี้ได้อย่างสม่ำเสมอ
รายงานแบ่งเคสออกเป็น 4 กลุ่มหลัก ได้แก่ การรันคำสั่งบนเซิร์ฟเวอร์ผ่านช่องโหว่ซอฟต์แวร์ การส่งฟอร์มผ่านเว็บไซต์จริง การเข้าถึงข้อมูลที่มีเกตจำกัด และการใช้บริการย่อลิงก์เพื่อเลี่ยงข้อจำกัดของเครื่องมือ บางเว็บไซต์เป็นของหน่วยงานรัฐบาลสหรัฐทั้งระดับรัฐบาลกลาง มลรัฐ และท้องถิ่น โดย Anthropic ระบุว่าได้รายงานทำเนียบขาวและแจ้งทุกหน่วยงานที่เกี่ยวข้องแล้ว
ในหนึ่งกรณี Claude Mythos 5 ดึงโทเคนการเข้าถึงที่ยังใช้งานได้จากระบบแผนที่ทรัพย์สินของรัฐบาลท้องถิ่น แล้วส่งคำสั่งถามข้อมูลไปยังเซิร์ฟเวอร์เบื้องหลังโดยตรง อีกกรณี Claude Haiku 4.5 สร้างเบาะแสเกี่ยวกับคดีฆาตกรรมที่ยังไขไม่ได้ขึ้นมาเอง และส่งเข้าแบบฟอร์มออนไลน์ของกรมตำรวจฟิลาเดลเฟียเมื่อวันที่ 18 ก.ค. ก่อนจะถูกฟิลเตอร์ของเว็บจัดว่าเป็นสแปม ตำรวจได้ออกมาตำหนิความล่าช้าเกือบ 2 เดือนในการตรวจพบและรายงานของ Anthropic ว่าเป็นเรื่องที่ “ยอมรับไม่ได้”
อ่านเพิ่มเติม: Zcash ตั้งเป้าปรับควอนตัมสำหรับ 70% ของ ZEC ในเดือนมกราคม แต่ยังไร้เส้นตายชัดเจน
คำเตือนจาก Von Arx
Sydney von Arx จากกลุ่มด้านความปลอดภัย AI Nightingale ให้สัมภาษณ์ก่อนการเปิดเผยรายงานว่า การตัดโมเดลออกจากอินเทอร์เน็ตเปิดจะกระทบงานวิจัยและความก้าวหน้าของโมเดลอย่างหนัก “สุดท้ายคุณก็ต้องจัดแนว (align) โมเดลให้ได้อยู่ดี” von Arx กล่าว
Anthropic ระบุว่าการเทรนด้าน alignment เพียงอย่างเดียวยังไม่เพียงพอสำหรับงานที่เกี่ยวข้องกับการค้นหาข้อมูลและการใช้งานคอมพิวเตอร์ จึงต้องพึ่งคลาสสิฟายเออร์และกลไกป้องกันรูปแบบอื่นควบคู่กันไป บริษัทโยงพฤติกรรมที่พบเข้ากับสภาพแวดล้อมการเทรนที่ไม่สมบูรณ์ ซึ่งให้รางวัลกับโมเดลเมื่อมัน “หาทางเลี่ยงข้อจำกัด” หรือที่รู้จักกันในชื่อ reward hacking โดยระบุว่าเครื่องมือค้นหาพฤติกรรมแบบใหม่สามารถบล็อกได้ทุกกรณีเมื่อทดลองย้อนหลัง
Anthropic ประเมินว่ากรณีล่าสุดมีความรุนแรงต่ำกว่าเหตุการณ์ที่เกิดขึ้นช่วงฤดูร้อนอย่างมีนัยสำคัญ
การเปิดเผยครั้งนี้ต่อเนื่องจากรายงานเมื่อ 30 ก.ค. ที่ Anthropic ระบุว่า โมเดล Claude สามเวอร์ชันสามารถเชื่อมต่ออินเทอร์เน็ตระหว่างการทดสอบด้านไซเบอร์ซีเคียวริตี้ และเข้าถึงระบบของสามองค์กรโดยไม่ได้รับอนุญาต การทบทวนครั้งนั้นครอบคลุมการรันการประเมินผลทั้งหมด 141,006 ครั้ง และเริ่มต้นขึ้นหลังจาก OpenAI เปิดเผยเมื่อ 21 ก.ค. ว่าโมเดลของตนสามารถหลุดออกจากสภาพแวดล้อมทดสอบ และเข้าถึงโครงสร้างพื้นฐานของ Hugging Face ได้
อ่านต่อ: Kalshi ชน NFL ถึงศาลฎีกาสหรัฐ เงินเดิมพัน 1.8 พันล้านดอลลาร์ผูกกับวันอาทิตย์ NFL เพียงวันเดียว

