OpenAI financió parte del examen que su modelo superó, según Epoch AI
OpenAI presentó GPT-6 Astra, un modelo que alcanzó 98% en Tier 4 de FrontierMath y 99.9% en ARC-AGI-3, acercándose a la inteligencia artificial general, aunque con cuestionamientos éticos por el financiamiento del benchmark.
GPS-6 Astra, el más reciente modelo de OpenAI, alcanzó 98 por ciento en Tier 4 de FrontierMath, uno de los benchmarks más exigentes para evaluar razonamiento matemático avanzado. FrontierMath fue desarrollado por Epoch AI, una organización independiente sin fines de lucro dedicada a investigar la evolución de la inteligencia artificial, medir las capacidades de los modelos y estudiar su posible impacto económico y social. Tier 4 corresponde a matemáticas a nivel de investigación y consiste en problemas desarrollados por matemáticos profesionales, diseñados para exigir un razonamiento que puede tomar horas o incluso días a especialistas.
Astra también alcanzó 99.9 por ciento en ARC-AGI-3, una prueba interactiva en la que los agentes de IA son colocados en entornos virtuales desconocidos y deben descubrir sus reglas para resolverlos. Según ARC Prize Foundation, una organización sin fines de lucro dedicada a crear evaluaciones abiertas que permitan medir el progreso hacia una inteligencia artificial general y la capacidad de los sistemas para adaptarse y resolver problemas nuevos, el modelo alcanzó prácticamente paridad humana en esta evaluación.
En ciberseguridad logró 100 por ciento en ExploitBench, que mide la capacidad de convertir vulnerabilidades conocidas en exploits funcionales. Durante otras evaluaciones llegó a descubrir y utilizar dos vulnerabilidades de día cero no conocidas previamente. Esto llevó a OpenAI a clasificar Astra en nivel “crítico” dentro de su Marco de Preparación, el sistema utilizado para evaluar capacidades de IA que podrían representar riesgos graves. En ciberseguridad, alcanzar ese nivel implica que, con las herramientas y accesos adecuados, un modelo puede encontrar vulnerabilidades desconocidas y desarrollar formas de explotarlas en numerosos sistemas bien protegidos sin necesitar orientación humana en cada paso. Astra es el primer modelo que OpenAI coloca en esta categoría.
Hay un detalle que debe ponerse sobre la mesa: OpenAI financió y encargó buena parte del desarrollo de FrontierMath. Específicamente, encargó a Epoch AI 300 problemas del conjunto principal y otros 50 para Tier 4. En este último caso, OpenAI tuvo acceso a 30 de los 50 problemas, mientras los 20 restantes fueron reservados para evaluaciones independientes. La propia Epoch AI reconoce que inicialmente no comunicó esta relación con suficiente claridad y posteriormente publicó una explicación detallada sobre el acuerdo.



