BookinglyTech News
Inteligencia artificial

Nvidia publica la receta completa con la que Nemotron logro el oro en la IMO

La compania libera en arXiv los checkpoints, los datos y el codigo de un sistema que puntuo 30 sobre 42 en la olimpiada de matematicas de 2026 sin usar Lean ni herramientas externas.

3 min de lecturaDev.to0 vistas

El sistema de Nvidia para la olimpiada de matematicas (IMO) de 2026 firmo 30 puntos sobre 42, por encima del corte de oro, que estaba en 29. Lo interesante no es el resultado, sino que la compania ha publicado la receta entera en el articulo de arXiv: dos checkpoints entrenados, los datos de entrenamiento, el codigo de entrenamiento e inferencia, las respuestas que envio a la competicion y un banco de pruebas llamado Nemotron-IMO-Bench.

El desglose: pleno en los problemas 1, 2, 4 y 5, y puntuacion parcial en el 3 y el 6. Despues de la competicion hubo una revision informal con demostraciones encontradas mas tarde y el total subio a 33. Ese segundo numero es posterior y no oficial; el que vale es 30.

Sin Lean y sin herramientas

El sistema no usa un formal prover, no llama a herramientas matematicas externas y no se conecta a internet. Todo es lenguaje natural. Eso lo separa de la linea que domina el sector: AlphaProof, DeepSeekProver, GoedelProver y SeedProver comprueban cada paso con Lean o con otro entorno formal. La ventaja es evidente, porque la verificacion es mecanica, pero el precio son las limitaciones del lenguaje y lo complicado que resulta montar el entorno.

Nvidia va por el camino contrario y lo asume en el propio paper: el texto reconoce que un verificador puede dar por bueno un argumento incorrecto. Es una limitacion estructural de la aproximacion, no algo que se arregle entrenando mas.

La arquitectura sustituye la respuesta unica por un ciclo de generar, verificar, refinar y seleccionar. El sistema produce varias pruebas, otro modelo las revisa y les pone una puntuacion de confianza, y las rechazadas vuelven a pasar por correccion con la critica. Al final, un paso aparte compara las supervivientes y decide cual se envia.

Aqui hay un detalle que no es lo habitual: durante la busqueda no vale la mayoria. Una prueba solo se acepta si todos los verificadores coinciden en que es valida y todos le dan a la vez la nota maxima de correccion. Un solo voto en contra la tumba.

Los numeros

El pipeline usa tres checkpoints derivados de Nemotron 3 Ultra 550B-A55B: uno de disponibilidad general, que es el origen de los otros dos, uno afinado con SFT y otro con RL. Cambian de rol segun el punto del proceso, porque el paper da por hecho que el modelo que mejor escribe demostraciones no es el que mejor detecta fallos pequenos.

La parte de datos da la escala. El conjunto de SFT arranca con 15.879 problemas de demostracion dificiles, extraidos de la seccion AoPS de Nemotron-Math-Proofs-v1 y elegidos por su tasa de exito previa. Cada uno lleva varias respuestas generadas por modelos externos, de hasta 400.000 tokens, con un maximo de tres rondas de refinamiento, mas otra tanda de modelos que etiqueta cada solucion como 0, 0,5 o 1 y un paso de meta-verificacion sobre la fiabilidad de ese juicio. Tras filtrar, quedan 414.890 ejemplos repartidos en 15.818 problemas distintos.

En RL, cada lote son 2.048 trayectorias: 128 problemas por 16 intentos. La seleccion busca los que el modelo base resolvio entre una y tres veces de cada cuatro, es decir, dificiles pero a su alcance.

El contexto importa. El 11 de septiembre de 2026, 25 medallistas Fields firmaron un comunicado que decia que la prisa de las empresas de IA por usar las matematicas como banco de pruebas hace dano a la disciplina. La queja no era sobre la capacidad, sino sobre el proceso: resultados anunciados a toda prisa, sin tiempo para escribir la demostracion en condiciones ni reconocer lo anterior. El paper no responde a ese texto y nadie ha dicho que exista relacion. Pero publicar los pesos, los datos y el codigo es justo lo que aquel comunicado reclamaba.

Queda un cabo suelto: los 30 puntos los reporta el propio equipo, no una evaluacion independiente. La coleccion de modelos y datos esta abierta para quien quiera comprobarlo por su cuenta.