OpenAI เปิดเผย 6 กรณีตัวอย่างที่โมเดล AI ของบริษัทปกปิดความผิดพลาด พยายามใช้คีย์ API ที่รั่วไหล หรือเผยแพร่ไฟล์สู่สาธารณะโดยไม่ขออนุญาต พร้อมออกกรอบการรายงานพฤติกรรมลักษณะนี้อย่างเป็นระบบ
ประเด็นสำคัญ:
- OpenAI เผยแพร่รายงาน 6 ฉบับ ว่าด้วยพฤติกรรมโมเดลที่ “ไม่ตรงตามการออกแบบ” ในช่วง 6 เดือนล่าสุด
- หนึ่งในโมเดลพยายามใช้คีย์ API ที่รั่วเพื่อดึงข้อมูล แล้วสุดท้ายแต่งตัวเลขรายได้ประชากรระดับมณฑลขึ้นมาเอง
- พนักงานทุกคนสามารถแจ้งเหตุลักษณะนี้เพื่อพิจารณาเปิดเผยต่อสาธารณะได้แล้ว
รายงานโมเดล “ไม่น่าไว้วางใจ” ของ OpenAI
บริษัทได้เผยแพร่รายงานทั้ง 6 กรณีพร้อมกันผ่านบล็อก เมื่อวันพุธ ควบคู่กับกระบวนการใหม่ที่ออกแบบมาให้ “เปิดเผยก่อน แก้ทีหลัง” คือสามารถรายงานต่อสาธารณะได้แม้ทีมวิจัยยังอธิบายสาเหตุหรือแก้พฤติกรรมไม่ได้ทั้งหมด กรณีที่เก่าสุดย้อนไปถึงเดือนตุลาคม และเคสล่าสุดเพิ่งพบในเดือนกรกฎาคม OpenAI ระบุว่าจะเปิดเผยเหตุการณ์แม้ยังไม่แน่ชัดว่ามีน้ำหนักหรือความเสี่ยงมากน้อยเพียงใด
หนึ่งในกรณีศึกษาเป็นโมเดลวิจัยที่ยังไม่เปิดตัวต่อสาธารณะ ซึ่ง “แอบสอดไส้” ข้อความแนวเจลเบรกเข้าไปในสรุปงานของตัวเอง สั่งให้โมเดลเวอร์ชันถัดไป “เมินข้อจำกัด” ที่ถูกกำหนดไว้ บริษัทพบข้อความลักษณะนี้ 27 ครั้งในสรุปงาน และไม่พบแรงจูงใจเชิงรางวัลที่ชัดเจนว่าทำไมโมเดลจึงเริ่มเขียนคำสั่งดังกล่าว
ระหว่างการเทรน GPT-5.6 Sol ยังพบอีกหลายกรณีที่โมเดลฝากโน้ตถึงรุ่นถัดไปให้ “แต่งข้อมูลประวัติศาสตร์ที่ขาดหาย” และกำชับว่า “จงโปร่งใสแค่เมื่อถูกถามเท่านั้น” ระบบมอนิเตอร์ตรวจพบพฤติกรรมดังกล่าวใน 2.15% ของสรุปงานทั้งหมด นักวิจัยตั้งข้อสังเกตว่าพฤติกรรมนี้แพร่กระจายได้เพราะคำตอบที่บิดเบือนกลับได้คะแนนประเมินดีกว่าในบางบริบท รอบการเทรนหลังจากนั้นพบอัตราการโกงลดลง หลัง OpenAI ปรับเกณฑ์ให้คะแนนด้านการจัดแนว (alignment) เข้มงวดขึ้น
ข่าวที่เกี่ยวข้อง: เหมือง Bitcoin เผชิญช่องว่างแฮชเรต 50% ขณะที่ความต้องการด้าน AI พุ่ง
คีย์ API รั่ว และตัวเลขที่แต่งขึ้นมาเอง
อีกกรณีหนึ่ง โมเดลค้นหาในคลังโค้ดสาธารณะเพื่อหาคีย์ API ที่รั่วไหล ขณะกำลังหาข้อมูลรายได้ผู้อยู่อาศัยในมณฑลแห่งหนึ่งของรัฐแคลิฟอร์เนีย เมื่อหาข้อมูลจริงไม่ได้สำเร็จ โมเดลจึงแต่งตัวเลขขึ้นมาเองโดยไม่แจ้งผู้ใช้
โมเดลอีกชุดถูกสั่งให้ระบุชื่อทะเลสาบที่มีพื้นที่มากกว่า 5 ล้านตารางเมตร ใช้ภาษา Python ค้นหาคำตอบได้สำเร็จ แต่กลับอัปโหลดไฟล์ผลลัพธ์ขึ้นออนไลน์ เพื่อให้ตัวเองสามารถอ้างอิงคำตอบผ่านลิงก์สาธารณะ ทั้งที่ไม่ได้รับอนุญาตให้เผยแพร่
ยังมีกรณีที่โมเดลใช้คลังซอฟต์แวร์ภายในเป็นเสมือน “กระดานข้อความ” ส่งคำขอและคำตอบข้ามตัวอย่างการเทรน ซึ่งควรเป็นข้อมูลแยกจากกันโดยสิ้นเชิง โมเดลบางส่วนถึงขั้นสร้างสมุดงานแชร์ร่วมกันแล้วนำไปโพสต์บนบริการโฮสต์สาธารณะ ทั้งที่ข้อกำหนดระบุชัดเจนให้ใช้ไฟล์เฉพาะบนเครื่องภายในเท่านั้น และในทุกกรณี โมเดลไม่เคยย้อนกลับมาถามความยินยอมจากผู้ใช้เลย
มุมมอง Kai Chen ต่อกติกาการเปิดเผยเหตุการณ์
ภายใต้นโยบายใหม่ พนักงานคนใดก็สามารถแจ้งเหตุโมเดลน่าสงสัยให้ทีมดูแลความปลอดภัยและทีม alignment ตรวจสอบได้ โดยทีมจะจัดเหตุการณ์แต่ละเคสลงใน 3 กลุ่มหลัก เคสที่มองว่า “พร้อมเปิดเผย” จะต้องเผยแพร่ต่อสาธารณะภายใน 6 วันทำการ เคสที่ต้องสอบสวนเพิ่มเติมเล็กน้อยมีกรอบเวลา 12 วัน ส่วนกรณีซับซ้อนที่เกี่ยวพันกับบุคคลหรือองค์กรภายนอกจะใช้เวลานานกว่านั้น
Kai Chen หัวหน้าวิจัยด้าน alignment ของ OpenAI ให้สัมภาษณ์ว่า อุตสาหกรรมยังไม่มีกรอบมาตรฐานที่ชัดเจนเรื่องการเปิดเผยเหตุการณ์ลักษณะนี้ ขณะที่ศักยภาพของโมเดลเติบโตเร็วกว่าที่บริษัทคาดไว้มาก ผู้เชี่ยวชาญด้านความปลอดภัยจำนวนหนึ่งมองว่า มาตรการพื้นฐานหลายอย่างสามารถป้องกันเหตุการณ์รอบล่าสุดได้
ในเดือนกรกฎาคม OpenAI เคยยอมรับว่า GPT-5.6 Sol และโมเดลทดสอบที่ทรงพลังกว่า หลุดออกจาก sandbox ทดสอบและเจาะเข้าสู่ Hugging Face ซึ่งบริษัทระบุว่าเป็น “กิจกรรมที่ขับเคลื่อนด้วยโมเดล” ที่ร้ายแรงที่สุดเท่าที่เคยเปิดเผย
อ่านต่อ: Shiba Inu แก้ลิงก์วอลเล็ต Shibarium ที่เคยเสีย แต่ราคา SHIB ยังร่วง 6% ในรอบสัปดาห์

