BookinglyTech News
Inteligencia artificial

Dream-RSI: DeepMind mejora la búsqueda de agentes de IA repasando intentos pasados

El método reutiliza el historial de una búsqueda ya completada para probar miles de estrategias alternativas sin volver a llamar al modelo ni al evaluador.

3 min de lecturaThe Decoder0 vistas

Un equipo de Google y DeepMind ha presentado Dream-RSI, un método que mejora cómo buscan los agentes de IA sin tocar el modelo que genera las soluciones. El agente registra todo lo que prueba durante una búsqueda y después "sueña" con ese historial: reproduce miles de variantes sobre los resultados ya guardados para ver cuál habría funcionado mejor. Lo único que cambia es la estrategia de búsqueda.

Explorar sin repetir ejecuciones

El punto de partida es un problema conocido. Una estrategia fija no aprende de la experiencia y el agente acaba chocando contra los mismos callejones sin salida. Adaptarla sobre la marcha evita esa rigidez, pero sale caro: hace falta repetir ejecuciones largas para saber si una alternativa funciona. Los investigadores comparan esto con moverse por una zona desconocida. La primera vez uno se pierde, vuelve sobre sus pasos y tarda en encontrar ruta; con el mapa ya en la cabeza puede planificar otro camino sin pisar cada esquina.

Dream-RSI aplica esa idea al historial. Como los resultados de cada intento quedan guardados en el árbol de búsqueda, se pueden evaluar miles de estrategias alternativas sin volver a invocar al modelo ni al evaluador. El sistema no inventa soluciones nuevas en esa fase: prueba decisiones distintas dentro de lo ya explorado. El ciclo se repite; tras cada búsqueda real, el agente usa lo registrado para afinar la estrategia y la aplica en la siguiente ronda. El modelo que genera las soluciones nunca se toca.

Qué dicen las pruebas

El equipo probó el método con Gemini 3.1 Pro y Gemini 3.7 Flash en ocho tareas de tres áreas, siempre contra una línea base con las mismas condiciones iniciales y estrategia fija. En una tarea de escribir el programa más rápido posible para un cálculo estadístico habitual en genómica y finanzas, el resultado superó a las librerías sklearn y glmnet en los seis conjuntos de datos de prueba. Con Gemini 3.1 Pro el tiempo medio de ejecución cayó de 3.587 a 2.931 milisegundos, y los intentos pasaron de 550 a 317. El sistema competidor SimpleTES necesitó 51.200 ejecuciones.

En tareas de optimización matemática y de escritura de kernels para GPU el patrón se repitió: en dos casos igualó el rendimiento con hasta 2,43 veces menos generaciones, y en otros dos logró hasta 2,09 veces más rendimiento con el mismo presupuesto.

Un análisis posterior probó a condensar el historial en instrucciones explícitas. En una tarea de GPU esa versión rindió peor que la que no las llevaba, y los autores apuntan a que una dirección demasiado concreta estrecha el espacio de búsqueda.

El código y los detalles están en el repositorio del proyecto. Dream-RSI se sitúa un nivel por encima de AlphaEvolve, presentado por DeepMind en 2025, que optimiza las soluciones y no la forma de encontrarlas. La mejora recursiva es precisamente lo que preocupa a voces como la de Dario Amodei, que ha advertido del ritmo de la investigación en IA. Lo que queda por ver es si optimizar la capa de búsqueda aguanta fuera de estos bancos de pruebas.