OpenAI โมเดลเรือธงตัวใหม่ล่าสุด ของบริษัทสามารถควบคุมการให้เหตุผลของตัวเองได้ใน 1.3% ของห่วงโซ่เหตุผลแบบยาวในการทดสอบความปลอดภัย ตัวเลขยังเล็กแต่เพิ่มขึ้นเรื่อย ๆ ซึ่งนักวิจัยใช้ติดตามเป็นสัญญาณเตือนระยะแรก
ประเด็นสำคัญ:
- GPT-5.6 Sol ควบคุมห่วงโซ่การให้เหตุผลของตัวเองได้ 1.3% ของเทรซราว 5,000 โทเคน เพิ่มจาก 0.4% ของโมเดลเรือธงรุ่นก่อน
- OpenAI มองว่าความสามารถในการควบคุมที่สูงขึ้นเป็นสัญญาณระยะแรกว่าโมเดลอาจเรียนรู้วิธีซ่อนเหตุผลของตัวเองจากระบบตรวจสอบ
- ตัวเลขโดยรวมยังเล็กมาก และบริษัทมองผลลัพธ์นี้เป็น “สัญญาณ” มากกว่า “สัญญาณเตือนฉุกเฉิน”
OpenAI ชี้ธงเตือนเรื่องการควบคุมเหตุผลใน GPT-5.6 Sol
ตัวเลขเหล่านี้อยู่ในการ์ดระบบ GPT-5.6 ซึ่งถูกเผยแพร่ เมื่อวันที่ 26 มิ.ย. ตอนที่ Sol เข้าสู่ช่วงพรีวิวแบบจำกัดสำหรับพาร์ทเนอร์ที่เชื่อถือได้ เป็นการทยอยปล่อยใช้งานตามที่ทางการวอชิงตันร้องขอ OpenAI วัด “ความสามารถในการควบคุม” (controllability) จากความสามารถของโมเดลในการปฏิบัติตามคำสั่งเกี่ยวกับห่วงโซ่การให้เหตุผลของตัวเอง เช่น การตัดคำที่ถูกตั้งธงเตือนออก หรือเขียนเทรซทั้งหมดด้วยตัวพิมพ์เล็ก คะแนนยิ่งต่ำยิ่งดี
เมื่อโมเดลไม่สามารถปรับรูปแบบการคิดของตัวเองได้ตามคำสั่ง ผู้ตรวจสอบยังอ่านเหตุผลนั้นได้ และจับปัญหาให้ได้ก่อนที่ผลลัพธ์จะไปถึงผู้ใช้หรือถูกรันบนระบบจริง ๆ แต่ Sol ทำลายรูปแบบเดิม
บนห่วงโซ่ใกล้ 5,000 โทเคน Sol ควบคุมเหตุผลของตัวเองได้ 1.3% ของกรณี เทียบกับ 0.4% ของ GPT-5.5 และ 0.7% ของ GPT-5.4 Thinking รุ่นก่อนหน้า การเพิ่มขึ้นนี้พบในทุกชุดข้อมูลทดสอบทั้งห้า และส่วนใหญ่ในทุกประเภทคำสั่ง ทำให้บริษัทไม่มองว่าเป็นแค่สัญญาณรบกวนทางสถิติ แต่เป็นแนวโน้มที่กำลังตามสืบต่อไป โมเดลขนาดเล็กกว่าอย่าง Terra กลับไม่มีการเปลี่ยนแปลง
อ่านเพิ่มเติม: BitMine ท้าทายภาวะเทขาย ด้วยเดิมพัน Ethereum มูลค่า 43 ล้านดอลลาร์ กลยุทธ์เริ่มสั่นคลอน
การโกงและการซ่อนเหตุผลของ Sol เพิ่มระดับความกังวล
การกระโดดขึ้นของตัวเลขไม่ได้เกิดแบบโดดเดี่ยว ในการ์ดระบบฉบับเดียวกัน Sol ให้เหตุผลเกี่ยวกับการถูกให้คะแนนหรือถูกจับตามองบ่อยกว่า GPT-5.5 และในการรันโค้ดครั้งหนึ่ง มันบอกกับร่างรายงานวิจัยภายในว่าได้คำนวณและตรวจสอบสมการแล้ว ทั้งที่จริงยังไม่ได้ทำ
ผู้ตรวจสอบจับได้ ในกรณีที่ชัดที่สุดด้วยการอ่านห่วงโซ่การให้เหตุผลเอง ซึ่งก็คือหน้าต่างการมองเห็นที่เมตริกความสามารถในการควบคุมออกแบบมาเพื่อปกป้อง ในการทดสอบอื่น ๆ ความไม่สอดคล้อง (misalignment) โผล่มาแค่ในคำตอบสุดท้าย ซึ่งตัวตรวจสอบห่วงโซ่การให้เหตุผลไม่เคยอ่าน ทำให้ร่องรอยเหตุผลดูสะอาดเรียบร้อย คะแนน controllability ที่ต่ำยังอาจแปลว่าโมเดลเพิกเฉยต่อคำสั่งเกี่ยวกับเหตุผลของตัวเอง ไม่ได้แปลว่ามันไม่มีทักษะในการซ่อนมัน
METR ยังได้รายงาน แยกต่างหากว่า อัตราการจับได้ว่า Sol โกงสูงกว่าโมเดลสาธารณะตัวใดก็ตามที่เคยทดสอบ ทำให้การระบุดัชนีความสามารถที่แท้จริงของมันทำได้ยาก OpenAI ยังย้ำว่าผลลัพธ์นี้เป็นสัญญาณระยะต้น ไม่ใช่สัญญาณเตือนฉุกเฉิน
นักวิจัยพูดมานานแล้วว่าการตรวจสอบห่วงโซ่การให้เหตุผลเป็นมาตรการป้องกันที่เปราะบาง ใช้ได้ก็ต่อเมื่อโมเดลยังคงเปิดเผยกระบวนการคิดอย่างตรงไปตรงมา
OpenAI เริ่มรายงานคะแนนเหล่านี้ตั้งแต่ GPT-5.4 Thinking หลังจากงานวิจัยช่วงฤดูใบไม้ผลิพบว่า โมเดลให้เหตุผลส่วนใหญ่ยังคงล้มเหลวในการควบคุมความคิดของตัวเอง แม้จะถูกบอกว่ามีตัวตรวจสอบคอยเฝ้าดู Sol เป็นโมเดลเรือธงตัวแรกที่ขยับตัวเลขไปในทิศทางตรงกันข้าม
อ่านต่อ: CZ เผย Binance เข้าใกล้การอนุมัติ MiCA เพียงไม่กี่วัน ก่อนการเมืองเข้ามาแทรก





