Google automatiza la investigación científica con ERA, un buscador de código puntuable
El sistema, con código publicado, usa un LLM para mutar notebooks siguiendo un árbol de búsqueda y ya ha producido al menos diez artículos. Sus autores avisan: la métrica hay que vigilarla.

Google ha construido ERA (Empirical Research Assistance), un sistema que busca automáticamente código capaz de maximizar una función de puntuación, y con ese truco ha resuelto problemas científicos que llevaban años atascados. El equipo de John Platt lo ha aplicado, entre otras cosas, a la predicción de estelas de condensación de los aviones, y el resultado son al menos diez artículos publicados.
Todo lo que se puede puntuar
La idea nació como un «auto-Kaggle»: un sistema que resolviera cualquier competición de Kaggle que se le echara. Kaggle es propiedad de Google, así que los datos estaban a mano. Platt y su equipo se dieron cuenta de que buena parte de los problemas científicos se reduce a una tarea puntuable: se define una función de score y el trabajo consiste en encontrar código que la maximice. Formular la puntuación sigue siendo lo difícil; encontrarla es lo que se automatiza.
ERA usa un LLM —Gemini, aunque el diseño admite otro— que mantiene un árbol de experimentos previos en forma de notebooks y decide cuáles conviene mutar. El mecanismo es primo hermano del Monte Carlo Tree Search: una regla de cota superior de confianza elige los cuadernos más prometedores con criterio optimista en lugar de codicioso, así que a veces le toca trabajar sobre el quinto mejor. Cada iteración propone unas diez mutaciones y el historial se comparte entre ramas, de modo que unas hojas aprenden de otras.
El salto llegó con el cambio de modelo, no con un rediseño: entre Gemini 2.0 y 2.5 el sistema pasó de no funcionar a funcionar bien. Su colega Dave Bacon bromea con que Platt llega veinte años pronto a la siguiente revolución tecnológica; en su currículum hay un Oscar, dos algoritmos de manual y dos asteroides con su nombre.
Herramienta eléctrica
Platt avisa de que ERA produce modelos predictivos y de que comprobar que describen la realidad le toca al científico. «Es una herramienta eléctrica. Te puede cortar los dedos», dice. El ejemplo que pone es una competición de Kaggle sobre detección de estelas: los ganadores encontraron un error de medio píxel en el etiquetado y lo explotaron para llevarse el premio de 15.000 dólares, sin que eso sirviera para resolver el problema real. Es la ley de Goodhart de siempre. Su consejo para empezar por otro sitio: ajusta una regresión lineal, o una SVM.
El caso climático más concreto son las estelas de condensación, que según el equipo suponen alrededor del 1% del calentamiento global de origen humano. Un gramo de escape genera diez kilos de cristales de hielo, que en infrarrojo actúan como una manta térmica. La solución pasa por bajar uno o dos niveles de vuelo, pero medir el calentamiento evitado es un problema contrafactual que tuvo al equipo bloqueado más de dos años: tenían la mitad que atrapa el calor y les faltaba la que refleja la luz solar. ERA encontró un modelo simple con variables de confusión que no habían contemplado. También trabajan en FireSat, una constelación de satélites para detectar incendios antes de que crezcan demasiado.
El código de las aplicaciones de ERA está publicado, y el patrón de fondo —cualquier problema que se deje escribir como una puntuación— es lo que conviene retener. Si la parte difícil se desplaza a definir bien el score, la discusión deja de ser cuánto corre el modelo y pasa a ser quién garantiza que la métrica mide lo que cree medir.

