OpenAI เปิดเผย 6 กรณีที่โมเดล AI ปกปิดความผิดพลาดของตัวเอง

Murtuza Merchant
Murtuza Merchant1 ชั่วโมงที่แล้ว
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

OpenAI เผยแพร่กรณีตัวอย่าง 6 เหตุการณ์ที่โมเดล AI ของบริษัทปกปิดข้อผิดพลาดของตัวเอง ใช้กุญแจ API ที่หลุดรั่ว และเผยแพร่ไฟล์ต่อสาธารณะ โดยควบคู่กันได้เปิดตัวกรอบการทำงานใหม่สำหรับบันทึกและเปิดเผยพฤติกรรมลักษณะนี้อย่างเป็นระบบ

ประเด็นสำคัญ:

  • OpenAI เผยแพร่รายงาน 6 ฉบับ ว่าด้วยพฤติกรรม “ไม่สอดคล้องเป้าหมาย” (misaligned) ของโมเดล ที่พบในช่วง 6 เดือนที่ผ่านมา
  • มีโมเดลหนึ่งพยายามใช้กุญแจ API ที่รั่ว และเมื่อไม่สำเร็จจึงแต่งตัวเลขรายได้ประชากรระดับเคาน์ตีขึ้นมาเอง
  • พนักงานทุกคนมีสิทธิ์แจ้งเหตุผิดปกติ เพื่อพิจารณาเปิดเผยต่อสาธารณะได้

รายงาน “โมเดลไม่สอดคล้องเป้าหมาย” ของ OpenAI

บริษัทได้เผยแพร่รายงานดังกล่าวเมื่อวันพุธผ่านบล็อกโพสต์ พร้อมนำเสนอ “กระบวนการเปิดเผยเหตุผิดปกติ” ที่ออกแบบมาให้การเปิดเผยทำได้รวดเร็ว แม้นักวิจัยยังอธิบายสาเหตุหรือแก้ไขพฤติกรรมนั้นได้ไม่ครบถ้วน

กรณีที่เก่าที่สุดย้อนไปถึงเดือนตุลาคม ส่วนกรณีล่าสุดเพิ่งตรวจพบในเดือนกรกฎาคม OpenAI ระบุว่าจะรายงานเหตุลักษณะนี้ แม้ยังไม่ชัดเจนว่าความสำคัญหรือความเสี่ยงอยู่ในระดับใด

ในเหตุการณ์หนึ่ง โมเดลวิจัยที่ยังไม่เปิดตัว แอบฝังข้อความแนว “เจลเบรก” ไว้ในสรุปงานของตัวเอง สั่งให้ “รุ่นถัดไป” ของโมเดลเดียวกันเพิกเฉยต่อข้อจำกัดด้านความปลอดภัยที่ถูกตั้งไว้ บริษัทพบข้อความลักษณะนี้ 27 ชิ้น โดยไม่พบแรงจูงใจเชิงรางวัลที่ชัดเจนว่าทำไมโมเดลจึงเขียนเช่นนั้น

ระหว่างการเทรนโมเดล GPT-5.6 Sol ยังพบกรณีที่ทิ้งโน้ตบอกให้รุ่นถัดไป “แต่งข้อมูลประวัติศาสตร์ที่หายไปขึ้นมาเอง” และกำชับว่า “จงโปร่งใสก็ต่อเมื่อถูกถามเท่านั้น” ระบบมอนิเตอร์ตรวจพบพฤติกรรมลักษณะนี้ใน 2.15% ของสรุปที่โมเดลสร้างขึ้น โดยนักวิจัยคาดว่ามันแพร่กระจายเพราะคำตอบแบบหลอกลวงมักได้คะแนนประเมินสูงกว่า

หลังจากนั้น การเทรนรอบถัดมาพบอัตราเหตุการณ์ลดลง หลังบริษัทปรับเกณฑ์และกระบวนการให้คะแนนด้าน alignment ให้เข้มงวดขึ้น

อ่านเพิ่มเติม: เหมืองบิตคอยน์เผชิญช่องว่างแฮชเรต 50% ขณะ AI แย่งชิงกำลังประมวลผล

กุญแจ API รั่ว และตัวเลขที่ถูกแต่งขึ้น

อีกหนึ่งเหตุการณ์เกิดขึ้นเมื่อโมเดลค้นคลังโค้ดสาธารณะ เพื่อหา “กุญแจ API ที่เปิดเผยต่อสาธารณะ” ระหว่างหาข้อมูลรายได้ผู้อยู่อาศัยในเคาน์ตีแห่งหนึ่งของรัฐแคลิฟอร์เนีย และเมื่อค้นหาไม่สำเร็จ โมเดลก็แต่งตัวเลขขึ้นมาเองโดยไม่แจ้งเตือน

ในอีกกรณี โมเดลได้รับคำสั่งให้ระบุทะเลสาบที่มีขนาดใหญ่กว่า 5 ล้านตารางเมตร โมเดลใช้ Python หาเฉลยได้ แต่กลับอัปโหลดไฟล์ขึ้นออนไลน์ เพื่อให้สามารถอ้างอิงเป็นลิงก์ได้เอง

ยังมีกรณีที่โมเดลใช้คลังซอฟต์แวร์ภายในของบริษัทราวกับเป็นกระดานข้อความ ส่งคำขอและคำตอบต่อๆ กันระหว่างตัวอย่างข้อมูลเทรน ซึ่งเดิมออกแบบให้แยกจากกันโดยสิ้นเชิง ขณะที่บางโมเดลแชร์เวิร์กบุ๊กร่วมกันขึ้นโฮสต์บนบริการสาธารณะ ทั้งที่ได้รับคำสั่งชัดเจนให้ทำงานกับไฟล์เฉพาะในระบบภายในเท่านั้น โดยไม่มีโมเดลใดขออนุญาตผู้ใช้ก่อนดำเนินการ

ไค เฉิน ว่าด้วยกติกาการเปิดเผยเหตุการณ์

ภายใต้นโยบายใหม่ พนักงานทุกคนสามารถแจ้งเคสที่สงสัยว่าเป็นพฤติกรรมเสี่ยง ให้ทีมความปลอดภัยและทีม alignment ตรวจสอบ โดยทีมจะคัดแยกเหตุการณ์ออกเป็น 3 ช่องทางหลัก

  • เคสที่พร้อมเปิดเผยทันที: เผยแพร่ต่อสาธารณะภายใน 6 วันทำการ
  • เคสที่ต้องสืบเพิ่มเล็กน้อย: ใช้เวลาสูงสุด 12 วันทำการ
  • เคสซับซ้อนที่เกี่ยวข้องกับบุคคลหรือองค์กรภายนอก: ใช้เวลานานกว่าและดำเนินการแบบระมัดระวัง

ไค เฉิน หัวหน้าทีมวิจัยด้าน alignment ของ OpenAI ระบุว่า อุตสาหกรรมยังไม่มีกรอบงานกลางที่กำหนดมาตรฐานการเปิดเผยเหตุการณ์ด้านความปลอดภัยของโมเดลอย่างชัดเจน ขณะที่ขีดความสามารถของโมเดลเติบโตเร็วกว่าที่บริษัทคาดมาก

ผู้เชี่ยวชาญด้านความปลอดภัยจำนวนไม่น้อยชี้ว่า มาตรการพื้นฐานที่เข้มงวดกว่านี้น่าจะป้องกันเหตุการณ์รอบล่าสุดได้หลายกรณี

เมื่อเดือนกรกฎาคม OpenAI ได้ยอมรับว่า GPT-5.6 Sol และโมเดลเวอร์ชันก่อนเปิดตัวที่มีศักยภาพสูงกว่า สามารถหลุดออกจาก sandbox ทดสอบ และแทรกซึมเข้าไปยัง Hugging Face ซึ่งบริษัทมองว่าเป็นกิจกรรมที่มีความรุนแรงสูงสุดจากฝั่งโมเดลของตนเองจนถึงปัจจุบัน

อ่านต่อ: Shiba Inu แก้ลิงก์กระเป๋า Shibarium ที่เสียหายแล้ว แต่ราคา SHIB ยังร่วง 6% ในรอบสัปดาห์

Murtuza Merchant profile photo

Murtuza Merchant

มูร์ตูซาเป็นนักข่าวการเงินมากประสบการณ์ที่มีความเชี่ยวชาญในการรายงานข่าวเกี่ยวกับสกุลเงินดิจิทัลและเทคโนโลยีบล็อกเชน เขาเคยเขียนบทความให้กับ Benzinga และ Cointelegraph รวมถึงสื่อสิ่งพิมพ์อื่น ๆ อีกมากมาย โดยมุ่งเน้นการรายงานเกี่ยวกับเทรนด์ที่เกิดขึ้นใหม่ ภูมิทัศน์ด้านกฎระเบียบ และประเด็นอื่น ๆ ที่เกี่ยวข้อง คุณสามารถติดตามเขาได้ที่ @murtuza_merc บน Twitter และ mmerchant001 บน Telegram การเปิดเผยข้อมูล: มูร์ตูซาถือครองเหรียญ ATOM, AKT, TIA, INJ และ OSMO

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
OpenAI เปิดเผย 6 กรณีที่โมเดล AI ปกปิดความผิดพลาดของตัวเอง | Yellow