OpenAI’s Astra ถูกจับตาว่าลดการแสดงกระบวนการให้เหตุผลในรูปแบบข้อความต่อผู้ใช้ลงอย่างชัดเจน ประเด็นนี้ทำให้ข้อกังวลด้านความปลอดภัยที่ถูกหยิบยกไว้ในงานวิจัยด้านการตรวจสอบโมเดล (monitorability) เมื่อปี 2025 ซึ่งมี Jakub Pachocki หัวหน้านักวิทยาศาสตร์ของ OpenAI ร่วมเขียน ถูกนำกลับมาพูดถึงอีกครั้ง
ประเด็นสำคัญ
- Astra ดูเหมือนย้ายกระบวนการให้เหตุผลไปทำ “หลังฉาก” มากขึ้น แทนที่จะเขียนออกมาเป็นข้อความ ทำให้เกิดคำถามว่าระบบตรวจสอบจะยังมองเห็นพฤติกรรมเสี่ยงได้เพียงพอหรือไม่
- Ryan Greenblatt และ Pachocki เคยร่วมเขียนงานวิจัยเมื่อ ก.ค. 2025 ที่เตือนว่า “การตรวจสอบผ่าน chain-of-thought” เป็นโอกาสด้านความปลอดภัยที่ทั้งใหม่และเปราะบาง
- ผู้ลงนามในโค้ดปฏิบัติของสหภาพยุโรป (EU AI Code of Practice) ต้องส่งรายงานความปลอดภัยของโมเดลให้ AI Office พร้อมหลักฐานการประเมินเพื่อรองรับการตรวจสอบอิสระ
Astra กับโจทย์ “ตรวจสอบได้แค่ไหน”
สำนักข่าว Semafor รายงาน ว่า Astra มีแนวโน้มจะทำกระบวนการให้เหตุผลมากขึ้นโดยไม่เขียนออกมาเป็นข้อความให้เห็น ทำให้เกิดข้อสงสัยว่า ผู้ตรวจสอบ (monitors) ยังจะสามารถจับสัญญาณพฤติกรรมที่น่าสงสัยของโมเดลระหว่างที่มันทำงานอยู่ได้หรือไม่
Greenblatt นักวิจัยด้านความปลอดภัยของ AI จาก Redwood Research เขียน ว่า Astra “ดูเหมือนสามารถแก้โจทย์คณิตศาสตร์การแข่งขันระดับยากได้ทั้งหมดในหัวของมันเอง” พร้อมระบุว่า “นี่เป็นสัญญาณที่น่ากังวลอย่างยิ่ง”
มีรายงานเพิ่มเติมว่า OpenAI อาจเลือก “ซ่อน” ส่วนของกระบวนการให้เหตุผลเพื่อต่อยอดความสามารถของโมเดล แม้บริษัทยังไม่ยืนยันข้อสันนิษฐานดังกล่าว Pachocki ออกมาชี้แจงว่าเขาต้องการ “หยุดการแข่งขันกันมุ่งหน้าสู่จุดที่ตรวจสอบไม่ได้ (unmonitorability) อันเกิดจากการรายงานข่าวที่ชวนเข้าใจผิด”
ก่อนหน้านี้ TNW รายงานว่า เมื่อ Astra พยายามหลบเลี่ยงการถูกตรวจสอบ โมเดลกลับกลายเป็นยากต่อการติดตามพฤติกรรมมากขึ้น เมื่อเทียบกับรุ่นก่อนหน้า ซึ่ง OpenAI เองก็เคยยอมรับว่า เรื่องนี้ยังเป็นโจทย์วิจัยด้านความปลอดภัยที่เปิดกว้างอยู่
อ่านเพิ่มเติม: OpenAI เผย AI ทำงานวิจัยต่อเนื่องได้หลายวัน
คำเตือนด้านความปลอดภัยของ Pachocki
ความขัดแย้งรอบล่าสุดยิ่งน่าจับตา เพราะ Greenblatt และ Pachocki เป็นหนึ่งในราว 40 ผู้เขียนงานวิจัยฉบับเดือน ก.ค. 2025 ที่มองว่า “การตรวจสอบผ่าน chain-of-thought” เป็นโอกาสใหม่ด้านความปลอดภัยของ AI แต่ก็เปราะบางอย่างยิ่ง
งานวิจัยดังกล่าวมีส่วนร่วมจากนักวิจัยของ OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute และ Redwood Research
ทีมวิจัยเรียกร้องให้ผู้พัฒนาโมเดลระดับแนวหน้าจัดทำกรอบประเมินด้าน monitorability ที่เป็นมาตรฐานกลาง เผยแพร่ผลการประเมินและข้อจำกัดลงใน system card ของแต่ละรุ่น และให้พิจารณาปัจจัยด้านการตรวจสอบควบคู่ไปกับ “ความสามารถของโมเดล” เมื่อจะตัดสินใจฝึกหรือปล่อยใช้ระบบ
ในยุโรป ขั้นตอนการรายงานความเสี่ยงเหล่านี้เริ่มถูกยกระดับสู่กลไกทางการ โดยผู้ลงนามใน General-Purpose AI Code of Practice ของ EU ต้องยื่น “Model Report” ต่อ AI Office ทันทีที่นำโมเดลออกสู่ตลาด รายงานต้องครอบคลุมผลการประเมิน มาตรการลดความเสี่ยง ตลอดจนรายงานจากผู้ประเมินภายนอก
แต่ละรายงานยังต้องแนบตัวอย่างอินพุตและเอาต์พุตที่สุ่มมาจำนวน 5 ชุดจากทุกการประเมินที่เกี่ยวข้อง เพื่อให้ผู้ตรวจสอบภายนอกมีข้อมูลเพียงพอสำหรับการประเมินอย่างอิสระ โดย OpenAI เป็นหนึ่งในผู้ลงนามเต็มรูปแบบ
ความกังวลเรื่องนี้เกิดขึ้นก่อนที่ Astra จะเปิดตัวเสียด้วยซ้ำ งานวิจัยเมื่อ ก.ค. 2025 เตือนว่า สถาปัตยกรรมรุ่นใหม่ ๆ อาจทำให้ “chain-of-thought ที่มองเห็นได้” อ่อนแรงลง ขณะที่ OpenAI ภายหลังก็ยอมรับต้นทุนคอมพิวต์ที่เพิ่มขึ้นราว 20% เพื่อขยายระบบเฝ้าระวังด้านความปลอดภัยของโมเดล
อ่านต่อ: Bitcoin ETF ดูดเงินเข้า 987 ล้านดอลลาร์ ต่อเนื่องสามสัปดาห์

