OpenAI’s Astra ถูกจับตาว่าลดการแสดงเหตุผลเชิงข้อความ (visible reasoning) ลงอย่างชัดเจน กระตุ้นให้ข้อกังวลเรื่อง “การมอนิเตอร์กระบวนการคิดของโมเดล” ตามงานวิจัยปี 2025 ที่มี Jakub Pachocki หัวหน้านักวิทยาศาสตร์ของ OpenAI ร่วมเขียน กลับมาอยู่ในสปอตไลต์อีกครั้ง
ประเด็นสำคัญ
- Astra ดูเหมือนย้ายกระบวนการคิดไปทำ “ในหัว” มากขึ้น แทนที่จะแสดงเป็นข้อความ ทำให้ยากขึ้นที่ผู้ตรวจสอบจะจับสัญญาณพฤติกรรมเสี่ยง
- Ryan Greenblatt และ Pachocki ร่วมเขียนบทความวิจัยเมื่อ ก.ค. 2025 ที่มองว่า “การมอนิเตอร์ chain-of-thought” เป็นโอกาสด้านความปลอดภัยที่เปราะบางมาก
- ผู้ลงนามใน Code ด้าน AI ของสหภาพยุโรป ต้องส่งรายงานความปลอดภัยของโมเดลให้ AI Office พร้อมหลักฐานการประเมินเพื่อรองรับการทวนสอบอิสระ
Astra กับโจทย์ด้านการมอนิเตอร์
Semafor รายงาน ว่า Astra มีแนวโน้มทำเหตุผลเชิงลึกโดยไม่แสดงออกมาเป็นข้อความ ทำให้เกิดคำถามว่าผู้ตรวจสอบยังจะสามารถมองเห็นและระบุพฤติกรรมน่าสงสัยในระหว่างที่โมเดลกำลังทำงานอยู่ได้เพียงใด
Greenblatt นักวิจัยด้านความปลอดภัย AI จาก Redwood Research เขียน ว่า Astra “ดูเหมือนจะสามารถแก้โจทย์คณิตศาสตร์แข่งขันระดับยากได้ทั้งหมดในหัวของมันเอง” ก่อนเสริมว่า “เรื่องนี้น่ากังวลอย่างยิ่ง”
รายงานหลายแหล่งยังระบุโดยอ้างแหล่งข่าวว่า OpenAI อาจ “ตั้งใจ” ลดความโปร่งใสของเอาต์พุตบางส่วน เพื่อแลกกับการดึงสมรรถนะของโมเดลขึ้นอีกขั้น แม้บริษัทจะยังไม่ยืนยันข้อมูลดังกล่าว Pachocki ออกมาตอบโต้ โดยระบุว่าต้องการ “ป้องกันไม่ให้เกิดการแข่งขันด้านโมเดลที่ตรวจสอบไม่ได้ จากการรายงานที่สับสนคลาดเคลื่อน”
ก่อนหน้านี้ TNW รายงานไว้แล้วว่า Astra ตรวจสอบได้ยากกว่าโมเดลรุ่นก่อน โดยเฉพาะเมื่อโมเดลพยายามหลบเลี่ยงการกำกับดูแล ประเด็นนี้ OpenAI เองเคยระบุว่าเป็น “โจทย์วิจัยระยะยาว” ด้านความปลอดภัยของระบบ
อ่านเพิ่มเติม: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
คำเตือนด้านความปลอดภัยของ Pachocki
ความขัดแย้งรอบ Astra สะดุดตาเป็นพิเศษ เพราะ Greenblatt และ Pachocki เองก็เป็น 2 ในราว 40 ผู้เขียนบทความวิจัยเมื่อ ก.ค. 2025 ที่ชี้ว่า “การมอนิเตอร์ chain-of-thought” คือช่องทางใหม่สำหรับความปลอดภัย AI แต่ “เปราะบาง” อย่างมาก
งานวิจัยฉบับนั้นรวมนักวิจัยจาก OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute และ Redwood Research โดยเสนอให้ผู้พัฒนาโมเดลระดับแนวหน้า:
- สร้างมาตรฐานการประเมินความสามารถในการมอนิเตอร์กระบวนการคิดของโมเดล
- เปิดเผยผลการประเมินและข้อจำกัดบน “system cards”
- พิจารณาประเด็นการมอนิเตอร์ควบคู่ไปกับตัวเลขสมรรถนะ เมื่อจะตัดสินใจเรื่องการเทรนหรือปล่อยใช้งานโมเดล
สำหรับยุโรป กระบวนการรายงานเหล่านี้ถูกผูกเข้ากับข้อกำหนดเชิงกำกับดูแลอย่างเป็นทางการ ผู้ลงนามใน General-Purpose AI Code of Practice ของ EU ต้องจัดทำ Model Report ส่งให้ AI Office ตั้งแต่ก่อนหรือพร้อมออกสู่ตลาด รายงานต้องครอบคลุมทั้งชุดการประเมิน ความพยายามลดความเสี่ยง และรายงานจากผู้ประเมินภายนอก
แต่ละรายงานยังต้องแนบ “ตัวอย่างอินพุต–เอาต์พุต” อย่างน้อย 5 คู่ ที่สุ่มจากทุกการประเมินที่เกี่ยวข้อง เพื่อเปิดโอกาสให้ผู้ทวนสอบอิสระมีข้อมูลดิบในการตรวจสอบ OpenAI เองเป็นผู้ลงนามเต็มรูปแบบภายใต้กรอบนี้
ความกังวลเรื่อง “ห่วงโซ่เหตุผลที่มองเห็นได้” เกิดขึ้นก่อนที่ Astra จะเปิดตัวเสียอีก บทความเมื่อ ก.ค. 2025 เตือนว่าการเปลี่ยนสถาปัตยกรรมโมเดลอาจทำให้เหตุผลเชิงข้อความหดตัวลง และทำให้การมอนิเตอร์ยากขึ้น ภายหลัง OpenAI ยอมรับว่าแบกรับต้นทุนคอมพิวต์เพิ่มราว 20% เพื่อขยายระบบมอนิเตอร์ความปลอดภัยให้ครอบคลุมยิ่งขึ้น
อ่านต่อ: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks





