• 2 min de lectura
Dos modelos clasifican el resultado n.º 3 de OpenMath como un avance revolucionario
GPT-5.6 Sol Pro y Fable 5 Max coinciden en que el resultado n.º 3 de OpenMath es un avance revolucionario, con al menos siete avances importantes.

Imagen: Hacker News
Dos evaluaciones de modelos de los resultados OpenMath de Epoch AI Research coinciden en que el resultado n.º 3 califica como un «Avance revolucionario», mientras que al menos siete resultados cumplen el criterio de «Avance importante» de la organización.
La comparación fue publicada por un usuario de Hacker News que dijo que las matemáticas subyacentes eran difíciles de evaluar para los no especialistas. Le pidieron a GPT-5.6 Sol Pro y a Fable 5 Max que clasificaran los resultados usando la rúbrica de OpenMath.
Cómo difieren las etiquetas de OpenMath
La rúbrica define tres niveles:
- Resultado sólido: Un investigador destacado en el área relevante estaría satisfecho si su producción típica abordara problemas de este calibre, aunque probablemente el trabajo atraería poca atención fuera de su subcampo.
- Avance importante: El matemático medio que trabaje en un área amplia, como teoría de números o teoría de grafos, se daría cuenta y probablemente dedicaría tiempo a entender al menos el esquema de la solución.
- Avance revolucionario: El matemático medio querría conocer el resultado aunque no fuera de su especialidad. Podría considerarse uno de los mejores resultados del año en todo el campo de las matemáticas.
Ambos modelos ubicaron el n.º 3 en la categoría superior. La publicación dice que eso ayuda a explicar por qué Sébastien Bubeck abrió su propia entrada con ese resultado.
Los modelos discreparon en una clasificación. Fable 5 Max calificó el n.º 7 como Resultado sólido, mientras que GPT-5.6 Sol Pro lo calificó como Avance importante. A pesar de esa discrepancia, ambas evaluaciones identificaron al menos siete Avances importantes entre los resultados.

Recomendado
Sber abre SIRIN para detectar errores en respuestas de IA
Puntuación conservadora y avances limítrofes
La guía oficial de OpenMath dice que los evaluadores deberían elegir la categoría más conservadora cuando varias categorías parezcan plausibles:
«Cuando varias categorías parecían plausibles para un problema, nos inclinamos por la opción conservadora. Sería decepcionante rebajar la notoriedad de un problema después de que se resolviera, mientras que siempre podemos destacar cualquier elemento inesperadamente interesante de una solución.»
La evaluación de Fable fue más allá en tres resultados: los n.º 1, n.º 4 y n.º 9 fueron juzgados como «Avances limítrofes». La publicación pide la opinión de AcerFur, pero no ofrece respuesta ni una evaluación matemática independiente.
La comparación también deja sin resolver cómo deberían ser finalmente clasificados los resultados subyacentes por los matemáticos. Informa las clasificaciones de los modelos, no una nueva evaluación de las demostraciones o de su importancia.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía Hacker News


