แวดวงคณิตศาสตร์กำลังตั้งคำถามว่าผลงานคณิตศาสตร์ 719 ฉบับที่สร้างโดย AI ของ OpenAI จะเชื่อถือได้มากน้อยเพียงใด หลังมีรายงานวิจัยฉบับหนึ่งระบุว่า หลักฐาน Navier–Stokes ที่บริษัทเคยประกาศไว้ มีข้อความไม่ตรงกับเวอร์ชันที่ตรวจสอบด้วยคอมพิวเตอร์
ประเด็นสำคัญ:
- แคตตาล็อกของ OpenAI ลดจาก 722 เหลือ 719 ฉบับ หลังบริษัทถอนงาน 3 ชิ้นเพราะพบข้อผิดพลาดเรื่อง “เครื่องหมาย”
- นักคณิตศาสตร์ในสหราชอาณาจักร 3 คน บันทึกจุดไม่สอดคล้องกัน 2 แห่ง ระหว่างบทพิสูจน์ Navier–Stokes ฉบับเขียน กับโค้ด Lean
- ผู้เขียนไม่ได้ระบุว่าหลักฐานผิด แต่ย้ำว่าการตรวจด้วยเครื่อง (machine check) ไม่อาจทดแทนการกลั่นกรองโดยผู้ทรงคุณวุฒิ
การปล่อยผลงานคณิตศาสตร์ของ OpenAI
OpenAI เผยแพร่ชุดผลงานดังกล่าวเมื่อวันที่ 6 ต.ค. ขณะที่รายงานฉบับหนึ่งที่เผยแพร่เมื่อวันพฤหัสบดีที่ผ่านมา ชี้ ว่าโครงการนี้เบี่ยงออกจากแนวปฏิบัติที่คณะนักคณิตศาสตร์อิสระวางไว้เป็น “มาตรฐาน” สำหรับห้องปฏิบัติการ AI แคตตาล็อกเริ่มต้นมีต้นฉบับ 722 ฉบับ ก่อนที่ OpenAI จะ ถอน ออก 3 ฉบับในวันถัดมา เพราะข้อโต้แย้งชิ้นหนึ่งพังลงจากข้อผิดพลาดเรื่องสัญลักษณ์เครื่องหมาย และอีก 2 ฉบับที่อิงอยู่บนข้อโต้แย้งนั้นต้องถูกถอดตามไป
แนวปฏิบัติดังกล่าว ซึ่งออกเมื่อ 29 ก.ย. โดย คณะที่ปรึกษาด้านคณิตศาสตร์และปัญญาประดิษฐ์ (Advisory Group on Mathematics and Artificial Intelligence) จำนวน 9 คน ผ่านแถลงการณ์ที่ เผยแพร่ ออนไลน์ เปิดหัวด้วยคำขอให้ห้องปฏิบัติการหยุดใช้โจทย์คณิตศาสตร์ชั้นสูงทดสอบโมเดลปิด (proprietary models) ชั่วคราว ขณะที่คลังของ OpenAI ระบุว่าเอกสารเหล่านี้มาจากการให้โมเดลภายในที่ยังไม่เปิดตัว ทดลองแก้ปัญหาวิจัยแบบเปิด
ในบรรดาผลลัพธ์ทั้งหมด มีเพียง 10 เรื่องที่มีสรุป “กระบวนการให้เหตุผล” ของโมเดลแนบท้าย ขณะที่ราว 42% ของผลลัพธ์ระดับหัวข้อใหญ่ (top-line results) ถูกแปลงเป็นหลักฐานอย่างเป็นทางการใน Lean ซึ่งเป็นภาษาโปรแกรมให้คอมพิวเตอร์ตรวจสอบความถูกต้องของบทพิสูจน์ได้
อ่านเพิ่มเติม: ซีอีโอ Anthropic ได้ค่าตอบแทนเท่าไร? เอกสาร IPO มีคำตอบ
ช่องโหว่ในหลักฐาน Navier–Stokes
Alexander Bastounis จาก King’s College London ร่วมกับ Fabian Circelli และ Anders Hansen จาก University of Cambridge ได้ร่วมกันตรวจสอบ หลักฐาน Navier–Stokes ที่ OpenAI ประกาศไว้เมื่อเดือนกันยายน พวกเขาระบุจุดที่ “ข้อโต้แย้งที่เขียนบนกระดาษ” ไม่สอดคล้องกับโค้ด Lean อยู่ 2 ตำแหน่ง รวมถึงกรณีหนึ่งที่โค้ด Lean พิสูจน์ได้เพียง “ค่าประเมินที่อ่อนกว่า” (weaker estimate) จากที่บทความอ้างไว้
ผู้เขียนย้ำว่าพวกเขา “ไม่ได้” ฟันธงว่าบทพิสูจน์ฉบับเขียนนั้นผิด แต่ประเด็นที่ต้องการชี้มีขอบเขตแคบกว่า นั่นคือ Lean สามารถยืนยันได้ว่า “ทฤษฎีบทสุดท้าย” เป็นจริง ทว่าไม่อาจรับรองได้ว่าบรรดาขั้นตอนกลาง ๆ ที่มนุษย์อ่านอยู่ระหว่างทางนั้นถูกต้องทุกประการ ดังนั้นบทพิสูจน์ลักษณะนี้ยังจำเป็นต้องผ่านการพิจารณาโดยผู้ทรงคุณวุฒิ (peer review) ตามปกติ
เจ้าของเหรียญฟีลด์ส Terence Tao เขียนข้อความเมื่อวันที่ 6 ต.ค. ว่าขณะนี้มีปัญหาถูก “แก้โดยคนป้อนพรอมต์ AI” (AI prompters) ที่ไม่ได้เข้าใจผลลัพธ์มากพอจะตอบคำถามเชิงลึกหรือขึ้นเวทีบรรยายอธิบายผลงานได้ ขณะที่ศาสตราจารย์ Melanie Matchett Wood แห่ง Harvard ซึ่งเป็นหนึ่งในสมาชิกคณะที่ปรึกษา ระบุว่า เมื่อผลงานแนวนี้ถูกปล่อยออกมา “ยังไม่มีมนุษย์คนใดเข้าใจมันอย่างแท้จริง และนั่นคือจุดเริ่มต้นของงานหนักหลังจากนี้”
ข้อพิพาทเรื่องหลักฐานของ OpenAI
คณะที่ปรึกษาฯ ระบุว่ามีเพียงชุมชนนักคณิตศาสตร์วงกว้างเท่านั้น ที่จะตัดสินได้ในท้ายที่สุดว่า OpenAI ปฏิบัติตามข้อเสนอแนะของคณะทำงานใกล้เคียงเพียงใด การจับตาครั้งนี้เกิดขึ้นหลังเดือนที่ตึงเครียดเป็นพิเศษ OpenAI ประกาศผล Navier–Stokes เมื่อวันที่ 8 ก.ย. นำไปสู่ข้อพิพาทเรื่องเครดิตผลงานกับนักคณิตศาสตร์จากมหาวิทยาลัยนิวยอร์ก Tristan Buckmaster และในอีกสามวันถัดมา บรรดาเจ้าของเหรียญฟีลด์ส 25 คนได้ร่วมกันออกแถลงการณ์ เตือนว่าผลงานคณิตศาสตร์ที่ผลิตด้วย AI จำนวนมากอย่างรวดเร็ว อาจสร้างผลกระทบเชิงลบต่อวงการ
อ่านต่อ: OpenAI เปิดผลงานคณิตด้วย AI 722 ฉบับสู่สาธารณะ แล้วปล่อยให้นักคณิตทั่วโลกเป็นผู้ตัดสิน

