BookinglyTech News
Inteligencia artificial

Vinyals deja DeepMind y lanza Discovery Loop para automatizar la investigación

El exvicepresidente de investigación de Google DeepMind cree que la mejora recursiva de la IA llegará, pero sin explosión de inteligencia, y monta una startup para atacar sus dos cuellos de botella.

3 min de lecturaThe Decoder0 vistas

Oriol Vinyals dejó Google DeepMind hace unos días y ya tiene nuevo destino: Discovery Loop, una startup con la que quiere automatizar el ciclo completo de la investigación científica. Antes de irse, en el Agentic AI Summit 2026, explicó por qué considera que la mejora recursiva (RSI) de los sistemas de IA es inevitable, pero lenta, y que no desembocará en una explosión repentina de inteligencia.

Vinyals era vicepresidente de investigación en DeepMind, donde trabajó en AlphaStar), AlphaCode y Gemini. Su tesis no es que la IA se estanque, sino que acelerará tareas concretas de investigación e ingeniería por un factor de diez o más sin que eso se convierta en una espiral autosostenida.

Qué significa mejorarse a uno mismo

La primera pregunta que plantea es qué se supone que mejora un sistema de este tipo. Puede tocar sus pesos, cambiar los datos de entrenamiento, reescribir el método con el que se entrena, ajustar las instrucciones que recibe en cada consulta, reconstruir sus herramientas externas (acceso a bases de datos, ejecución de código) o incluso alterar las métricas con las que mide su propio progreso. Cada opción trae problemas técnicos y regulatorios distintos.

El ciclo completo exige una idea prometedora, código que la implemente, experimentos que la prueben y una forma fiable de juzgar si el cambio sirvió de algo. La IA ya avanza en los dos pasos centrales. Generar ideas y evaluar resultados siguen siendo el problema.

Hoy la mejoría se mide de forma indirecta, con benchmarks de capacidades como SWE-Bench Pro o ML-Bench: se sube en la clasificación y se espera que la automejora aparezca como efecto colateral. Son pruebas baratas y bien definidas, pero cubren justo lo que ya funciona. Encima están el sobreajuste y el comportamiento estratégico: Vinyals lo vio durante años construyendo agentes que juegan, y sabe que tienden a explotar el objetivo, batiendo el marcador en lugar de jugar bien.

Los primeros benchmarks que miden automejora de forma directa empiezan a aparecer: se le da al sistema una métrica y un presupuesto de cómputo, y se mide cuánto se mejora solo. Salen caros, porque cada evaluación implica un agente trabajando horas en tareas muy alejadas de lo que de verdad importa. El ejemplo que pone: el agente optimiza el Tetris mientras el objetivo real es automatizar un laboratorio de investigación entero.

La generación de ideas está igual de verde. Investigar bien requiere lo que él llama olfato investigador, y nadie ha estudiado en serio cómo enseñarlo a un modelo. Los criterios que espera ver son los mismos que aplica un revisor de conferencias: originalidad, elegancia, eficiencia y si la técnica aguanta el paso del tiempo. Parte se puede codificar en reglas y comprobar con modelos de recompensa para entrenar después con refuerzo, pero es difícil y llevará tiempo. La revisión humana tampoco es barata ni especialmente buena detectando ideas fuertes.

A eso se suman límites físicos. Un chip no computa más rápido de lo que permiten su diseño y la velocidad de la luz: aunque la IA diseñe un algoritmo mejor, sigue atada al hardware. Y en algunos dominios el rendimiento humano puede estar ya cerca del techo, aunque nadie sabe a ciencia cierta cuánto margen queda. Vinyals lo resume preguntando cómo de bueno es AlphaGo comparado con una partida perfecta de go.

El equipo y el primer cliente

Discovery Loop la cofunda con Jeff Dean, que ejerce de CEO, Sanjay Ghemawat y Quoc Le, cofundador de Google Brain. Tres de los cuatro están entre los investigadores de IA más citados, y Ghemawat lo está en sistemas distribuidos. El plan es automatizar primero la investigación en IA, con la propia empresa como primer cliente, y extenderse después a otras disciplinas. En la web hablan de un futuro en el que un puñado de personas haga investigación y desarrollo más rápido y mejor que equipos enormes.

Queda por ver si el enfoque de evaluación directa se consolida o se queda en experimento caro. De momento, el mensaje de Vinyals va contra la corriente que promete acelerones: la automejora no es un interruptor, es un proceso con partes que todavía no sabemos ni medir.