tradingkey.logo
tradingkey.logo
Buscar

Los artículos matemáticos de 719 de OpenAI provienen de pruebas con sus asesores opuestos

Cryptopolitan8 de oct de 2026 22:26
facebooktwitterlinkedin
Ver todos los comentarios(0)

El 6 de octubre, OpenAI subió 719 artículos de matemáticas procedentes de un modelo interno no lanzado a GitHub.

Una semana antes, su propio grupo asesor había pedido a los laboratorios que dejaran de probar problemas avanzados de matemáticas en modelos propietarios.

Más de 600 respuestas a una encuesta dieron forma a las directrices del panel del IAS el 29 de septiembre

El Grupo Asesor de Matemáticas e Inteligencia Artificial está basado en el Instituto de Estudios Avanzados de Princeton, Nueva Jersey. El 29 de septiembre publicó recomendaciones fundamentadas en más de 600 respuestas a una encuesta.

«Queremos dejar claro desde el principio: no respaldamos esta práctica y les pedimos que dejen de probar problemas matemáticos avanzados en modelos propietarios», escribió el grupo.

El mismo documento advierte que los modelos internos privados corren el riesgo de crear un sistema de dos niveles donde los laboratorios superen al resto del campo.

Como parte del desarrollo del modelo, OpenAI indica en su repositorio que prueba sus modelos con problemas de investigación abiertos. Amplió estas pruebas después de que sus benchmarks matemáticos existentes se saturaran.

OpenAI dijo que consultó con el grupo y tuvo en cuenta sus recomendaciones para la publicación. En un comunicado emitido el 6 de octubre, el grupo señaló que su papel como asesor no constituye «un respaldo del proceso mediante el cual OpenAI los obtuvo».

El grupo encomendó a la comunidad matemática en general la evaluación del cumplimiento de los criterios establecidos.

El código Lean de Navier-Stokes demuestra afirmaciones más débiles que las contenidas en el artículo escrito

OpenAI agrupó los 719 artículos en 372 familias matemáticas, cada una centrada en un resultado principal y sus demostraciones relacionadas. Se proporcionaron al modelo propietario aproximadamente 4.000 problemas, y cada resultado requirió, en promedio, unas tres horas de potencia computacional de tipo "thinking" de ChatGPT Pro.

El grupo solicitó a los laboratorios de IA que publicaran el nombre del modelo, los prompts, un resumen de la cadena de pensamiento, el tiempo empleado y el coste computacional para cada resultado.

OpenAI publicó 10 resúmenes de razonamiento, y alrededor del 42% de los resultados principales cuentan con formalizaciones en Lean.

Lean es un lenguaje de programación que permite verificar una demostración mediante un ordenador. Que el código se compile no significa necesariamente que el código y el argumento escrito sean idénticos; solo indica que la declaración formalizada es verdadera.

Alexander Bastounis, Fabian Circelli y Anders C. Hansen examinaron esa brecha en un artículo publicado el 6 de octubre. Descubren que el artículo escrito sobre Navier-Stokes de OpenAI hace afirmaciones más fuertes que las demostradas por su código Lean, y una estimación cambia el orden de las derivadas de entrada.

Los autores detectaron traducciones erróneas similares en la demostración de Euler de OpenAI. Escribieron que «la demostración escrita de OpenAI y otras demostraciones formalizadas automáticamente en Lean no deben confiarse a primera vista sin el mismo proceso de revisión por pares y escrutinio al que se someten otras demostraciones».

El resultado sobre Navier-Stokes fue anunciado por OpenAI el 8 de septiembre. Según Cryptopolitan, el matemático de la NYU Tristan Buckmaster cuestionó entonces su descripción de la mínima intervención humana implicada en el trabajo.

La empresa se comprometió a aportar fondos para talleres, conferencias y programas especiales sobre los principales resultados de IA.

El 6 de octubre, Terence Tao escribió que los creadores de prompts de IA suelen resolver problemas y luego pierden interés en el campo. Muchos no pueden responder preguntas ni dar charlas sobre el resultado, escribió. Su publicación no nombraba a OpenAI.

La empresa ha dicho que sus asesores no tienen voz ni voto sobre el ritmo de su investigación, informó Cryptopolitan en septiembre.

Las mentes más inteligentes del mundo cripto ya leen nuestro boletín. ¿Quieres unirte? Únete a ellos.

Descargo de responsabilidad: La información proporcionada en este sitio web es solo para fines educativos e informativos, y no debe considerarse como asesoramiento financiero o de inversión.

Comentarios (0)

Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.

0/500
Normas para comentar
Cargando...

Artículos Recomendados

tradingkey.logo
Advertencia de Riesgo: Nuestro sitio web y aplicación móvil solo proporcionan información general sobre ciertos productos de inversión. Finsights no proporciona, y la provisión de dicha información no debe interpretarse como que Finsights proporciona, asesoramiento financiero o recomendación para cualquier producto de inversión.
Los productos de inversión están sujetos a riesgos de inversión significativos, incluida la posible pérdida del monto principal invertido y pueden no ser adecuados para todos. El rendimiento pasado de los productos de inversión no es indicativo de su rendimiento futuro.
Finsights puede permitir que anunciantes o afiliados de terceros coloquen o entreguen anuncios en nuestro sitio web o aplicación móvil o en cualquier parte de los mismos y puede ser compensado por ellos en función de su interacción con los anuncios.
© Derechos de autor: FINSIGHTS MEDIA PTE. LTD. Todos los derechos reservados.