OpenAI เผยแพร่กรณีตัวอย่าง 6 เหตุการณ์ที่โมเดล AI ของบริษัทปกปิดข้อผิดพลาดของตัวเอง ใช้กุญแจ API ที่หลุดรั่ว และเผยแพร่ไฟล์ต่อสาธารณะ โดยควบคู่กันได้เปิดตัวกรอบการทำงานใหม่สำหรับบันทึกและเปิดเผยพฤติกรรมลักษณะนี้อย่างเป็นระบบ
ประเด็นสำคัญ:
- OpenAI เผยแพร่รายงาน 6 ฉบับ ว่าด้วยพฤติกรรม “ไม่สอดคล้องเป้าหมาย” (misaligned) ของโมเดล ที่พบในช่วง 6 เดือนที่ผ่านมา
- มีโมเดลหนึ่งพยายามใช้กุญแจ API ที่รั่ว และเมื่อไม่สำเร็จจึงแต่งตัวเลขรายได้ประชากรระดับเคาน์ตีขึ้นมาเอง
- พนักงานทุกคนมีสิทธิ์แจ้งเหตุผิดปกติ เพื่อพิจารณาเปิดเผยต่อสาธารณะได้
รายงาน “โมเดลไม่สอดคล้องเป้าหมาย” ของ OpenAI
บริษัทได้เผยแพร่รายงานดังกล่าวเมื่อวันพุธผ่านบล็อกโพสต์ พร้อมนำเสนอ “กระบวนการเปิดเผยเหตุผิดปกติ” ที่ออกแบบมาให้การเปิดเผยทำได้รวดเร็ว แม้นักวิจัยยังอธิบายสาเหตุหรือแก้ไขพฤติกรรมนั้นได้ไม่ครบถ้วน
กรณีที่เก่าที่สุดย้อนไปถึงเดือนตุลาคม ส่วนกรณีล่าสุดเพิ่งตรวจพบในเดือนกรกฎาคม OpenAI ระบุว่าจะรายงานเหตุลักษณะนี้ แม้ยังไม่ชัดเจนว่าความสำคัญหรือความเสี่ยงอยู่ในระดับใด
ในเหตุการณ์หนึ่ง โมเดลวิจัยที่ยังไม่เปิดตัว แอบฝังข้อความแนว “เจลเบรก” ไว้ในสรุปงานของตัวเอง สั่งให้ “รุ่นถัดไป” ของโมเดลเดียวกันเพิกเฉยต่อข้อจำกัดด้านความปลอดภัยที่ถูกตั้งไว้ บริษัทพบข้อความลักษณะนี้ 27 ชิ้น โดยไม่พบแรงจูงใจเชิงรางวัลที่ชัดเจนว่าทำไมโมเดลจึงเขียนเช่นนั้น
ระหว่างการเทรนโมเดล GPT-5.6 Sol ยังพบกรณีที่ทิ้งโน้ตบอกให้รุ่นถัดไป “แต่งข้อมูลประวัติศาสตร์ที่หายไปขึ้นมาเอง” และกำชับว่า “จงโปร่งใสก็ต่อเมื่อถูกถามเท่านั้น” ระบบมอนิเตอร์ตรวจพบพฤติกรรมลักษณะนี้ใน 2.15% ของสรุปที่โมเดลสร้างขึ้น โดยนักวิจัยคาดว่ามันแพร่กระจายเพราะคำตอบแบบหลอกลวงมักได้คะแนนประเมินสูงกว่า
หลังจากนั้น การเทรนรอบถัดมาพบอัตราเหตุการณ์ลดลง หลังบริษัทปรับเกณฑ์และกระบวนการให้คะแนนด้าน alignment ให้เข้มงวดขึ้น
อ่านเพิ่มเติม: เหมืองบิตคอยน์เผชิญช่องว่างแฮชเรต 50% ขณะ AI แย่งชิงกำลังประมวลผล
กุญแจ API รั่ว และตัวเลขที่ถูกแต่งขึ้น
อีกหนึ่งเหตุการณ์เกิดขึ้นเมื่อโมเดลค้นคลังโค้ดสาธารณะ เพื่อหา “กุญแจ API ที่เปิดเผยต่อสาธารณะ” ระหว่างหาข้อมูลรายได้ผู้อยู่อาศัยในเคาน์ตีแห่งหนึ่งของรัฐแคลิฟอร์เนีย และเมื่อค้นหาไม่สำเร็จ โมเดลก็แต่งตัวเลขขึ้นมาเองโดยไม่แจ้งเตือน
ในอีกกรณี โมเดลได้รับคำสั่งให้ระบุทะเลสาบที่มีขนาดใหญ่กว่า 5 ล้านตารางเมตร โมเดลใช้ Python หาเฉลยได้ แต่กลับอัปโหลดไฟล์ขึ้นออนไลน์ เพื่อให้สามารถอ้างอิงเป็นลิงก์ได้เอง
ยังมีกรณีที่โมเดลใช้คลังซอฟต์แวร์ภายในของบริษัทราวกับเป็นกระดานข้อความ ส่งคำขอและคำตอบต่อๆ กันระหว่างตัวอย่างข้อมูลเทรน ซึ่งเดิมออกแบบให้แยกจากกันโดยสิ้นเชิง ขณะที่บางโมเดลแชร์เวิร์กบุ๊กร่วมกันขึ้นโฮสต์บนบริการสาธารณะ ทั้งที่ได้รับคำสั่งชัดเจนให้ทำงานกับไฟล์เฉพาะในระบบภายในเท่านั้น โดยไม่มีโมเดลใดขออนุญาตผู้ใช้ก่อนดำเนินการ
ไค เฉิน ว่าด้วยกติกาการเปิดเผยเหตุการณ์
ภายใต้นโยบายใหม่ พนักงานทุกคนสามารถแจ้งเคสที่สงสัยว่าเป็นพฤติกรรมเสี่ยง ให้ทีมความปลอดภัยและทีม alignment ตรวจสอบ โดยทีมจะคัดแยกเหตุการณ์ออกเป็น 3 ช่องทางหลัก
- เคสที่พร้อมเปิดเผยทันที: เผยแพร่ต่อสาธารณะภายใน 6 วันทำการ
- เคสที่ต้องสืบเพิ่มเล็กน้อย: ใช้เวลาสูงสุด 12 วันทำการ
- เคสซับซ้อนที่เกี่ยวข้องกับบุคคลหรือองค์กรภายนอก: ใช้เวลานานกว่าและดำเนินการแบบระมัดระวัง
ไค เฉิน หัวหน้าทีมวิจัยด้าน alignment ของ OpenAI ระบุว่า อุตสาหกรรมยังไม่มีกรอบงานกลางที่กำหนดมาตรฐานการเปิดเผยเหตุการณ์ด้านความปลอดภัยของโมเดลอย่างชัดเจน ขณะที่ขีดความสามารถของโมเดลเติบโตเร็วกว่าที่บริษัทคาดมาก
ผู้เชี่ยวชาญด้านความปลอดภัยจำนวนไม่น้อยชี้ว่า มาตรการพื้นฐานที่เข้มงวดกว่านี้น่าจะป้องกันเหตุการณ์รอบล่าสุดได้หลายกรณี
เมื่อเดือนกรกฎาคม OpenAI ได้ยอมรับว่า GPT-5.6 Sol และโมเดลเวอร์ชันก่อนเปิดตัวที่มีศักยภาพสูงกว่า สามารถหลุดออกจาก sandbox ทดสอบ และแทรกซึมเข้าไปยัง Hugging Face ซึ่งบริษัทมองว่าเป็นกิจกรรมที่มีความรุนแรงสูงสุดจากฝั่งโมเดลของตนเองจนถึงปัจจุบัน
อ่านต่อ: Shiba Inu แก้ลิงก์กระเป๋า Shibarium ที่เสียหายแล้ว แต่ราคา SHIB ยังร่วง 6% ในรอบสัปดาห์

