Un sector de la comunidad matemática cuestiona ahora la fiabilidad de los 719 manuscritos matemáticos generados por OpenAI, después de que un nuevo trabajo señalara que la prueba de Navier-Stokes anunciada por la compañía no coincide con su versión verificada por ordenador.
Puntos clave:
- El catálogo de OpenAI pasó de 722 a 719 manuscritos tras retirar tres trabajos por un error de signo.
- Tres matemáticos radicados en el Reino Unido documentan dos discrepancias entre la prueba escrita de Navier-Stokes y su código en Lean.
- Los autores no afirman que la prueba sea incorrecta, pero advierten de que la verificación automática no sustituye a la revisión por pares.
Lanzamiento de los resultados matemáticos de OpenAI
OpenAI publicó la colección el 6 de octubre, y un informe difundido el jueves concluyó que el proyecto se aparta de las directrices redactadas por un panel independiente de matemáticos para los laboratorios de IA. El catálogo se estrenó con 722 manuscritos. OpenAI retiró tres de ellos un día después, tras detectarse un error de signo que invalidaba un argumento y afectaba a otros dos trabajos que dependían de él.
Esas directrices, publicadas el 29 de septiembre por el Advisory Group on Mathematics and Artificial Intelligence, formado por nueve expertos, arrancan con una petición clara: que los laboratorios dejen de probar problemas avanzados de matemáticas en modelos propietarios. El repositorio de OpenAI indica que los artículos se generaron evaluando un modelo interno aún no comercializado sobre problemas de investigación abiertos.
Solo 10 resultados incluyen un resumen del razonamiento del modelo, y alrededor del 42% de los teoremas principales se han formalizado en Lean, un lenguaje de programación que permite a un ordenador comprobar una demostración.
También te puede interesar: ¿Cuánto gana el CEO de Anthropic? La OPV revela la cifra
Lagunas en la prueba de Navier-Stokes
Alexander Bastounis, del King's College London, y Fabian Circelli y Anders Hansen, de la Universidad de Cambridge, analizaron la prueba de Navier-Stokes que OpenAI anunció en septiembre. En su informe recogen dos puntos en los que el argumento escrito y el código en Lean divergen, entre ellos un caso en el que el código solo demuestra una cota más débil que la afirmada en el artículo.
Los autores subrayan que no se pronuncian sobre la corrección final de la demostración tal como está redactada. Su mensaje es más específico: Lean certifica que el teorema final se cumple, explican, pero no garantiza que los pasos intermedios que lee un humano sean válidos. Por ello, incluso las pruebas verificadas por máquina siguen necesitando revisión por pares.
El medallista Fields Terence Tao escribió el 6 de octubre que algunos problemas están siendo resueltos por “prompters de IA” que no comprenden lo suficientemente bien la salida del modelo como para responder preguntas o impartir conferencias sobre esos resultados. La profesora de Harvard Melanie Matchett Wood, integrante del grupo asesor, señaló que cuando se publican demostraciones de este tipo “ningún humano las entiende por completo, y es entonces cuando realmente empieza el trabajo”.
La disputa sobre la prueba de OpenAI
El grupo asesor ha reiterado que solo la comunidad matemática en su conjunto puede determinar hasta qué punto OpenAI ha seguido sus recomendaciones. Ese escrutinio llega tras un mes especialmente tenso. OpenAI anunció el resultado sobre Navier-Stokes el 8 de septiembre, lo que desencadenó un conflicto de atribución con el matemático de la Universidad de Nueva York Tristan Buckmaster, y tres días después 25 medallistas Fields lanzaron una declaración alertando de que una producción masiva de resultados mediante IA podría dañar la disciplina.
Lee también: Los 722 artículos matemáticos de IA de OpenAI ya son públicos: ahora los matemáticos deben evaluarlos

