Dream-RSI: hacer que el agente «soñe» con sus búsquedas pasadas
Un equipo de 17 investigadores de Google, Google DeepMind, la Universidad de Maryland y la Universidad de Virginia acaba de publicar un sistema que, en sus pruebas, recorta hasta 162 veces las llamadas que un agente de IA necesita para descubrir nuevo código, optimizar funciones matemáticas o escribir kernels de GPU más rápidos. La clave no es hacer al modelo subyacente más inteligente: es hacer que el agente recuerde lo que ya intentó y aprenda de ello antes de gastar cómputo otra vez.
El paper, alojado en arxiv.org/abs/2609.14858, se llama Dream-RSI y se apoya en una idea provocadora: la mayoría de los bucles de descubrimiento en IA repiten caminos que ya fallaron antes. El proyecto tiene sitio propio y el código está disponible en GitHub, así que cualquier equipo técnico puede reproducirlo y adaptarlo.
El truco: un «simulador de replay» construido con tu propio historial
El problema que diagnostican los investigadores es que, cuando un agente explora un espacio de búsqueda durante miles de ciclos, las políticas de exploración —dónde ramificar, qué correr en paralelo, cuándo parar— suelen estar escritas a mano y congeladas. Si el camino falla, el agente lo paga otra vez la próxima vuelta. La consecuencia, dicen, es «desperdiciar cómputo sustancial y limitar la eficiencia y escalabilidad del RSI».
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLa solución de Dream-RSI es convertir cada sesión de descubrimiento en un árbol histórico estructurado: cada decisión del agente y su resultado queda registrada. Con ese árbol en disco, el sistema puede responder a la pregunta «¿qué habría pasado si…?» sin volver a ejecutar el agente. Los autores lo llaman un simulador de replay.
El flujo tiene tres etapas:
- Online explore: el agente, guiado por una política humana, explora y va armando el árbol mientras registra cada traza.
- Construct replay simulator: el árbol se guarda en un repositorio reutilizable.
- Dreaming-based policy improvement: el agente propone políticas alternativas, las «imagina» sobre el árbol existente y se queda con la que mejor puntuación saca — todo sin gastar cómputo nuevo.
La frase del paper que mejor lo resume: «La historia siempre estuvo ahí; trabajos previos solo la leían como contexto estático para prompts o como datos de entrenamiento. El árbol de descubrimiento que el agente ya construyó es un simulador exacto del espacio de búsqueda que alcanzó».
Resultados: de kernels de GPU a problemas Lasso
El equipo evaluó Dream-RSI en tres familias de tareas. Los números, reportados en el paper, son los siguientes:
- Lasso discovery con Gemini-3.1-Pro: el runtime promedio bajó de 3.587,1 a 2.931,0 ms y las llamadas del agente cayeron de 550 a 317.
- Lasso discovery con Gemini-3.7-Flash: runtime de 2.516,7 a 2.350,6 ms y llamadas de 3.200 a 1.879.
- Baseline SimpleTES: corrió gpt-oss-120b durante 51.200 generaciones — es contra esa cifra que se obtiene el recorte de 162x.
- Kernels GPU: en las tareas VGG16 y LayerNorm, Dream-RSI logró rendimiento comparable usando 2,43x y 1,79x menos generaciones; en ConvDiv y ConvMax, alcanzó 2,09x y 1,44x más performance con el mismo presupuesto.
El test de ConvDiv — que mide eficiencia de cargas de trabajo de machine learning sobre la GPU — es el más interesante para casos de ingeniería: el número de intentos evaluados bajó de 110 a 50 antes de subir otra vez a unos 90 cuando el progreso se estancaba, una curva que muestra al sistema aprendiendo cuándo conviene seguir gastando y cuándo detenerse.
Por qué importa frente al debate Amodei–DeepMind sobre RSI
Dream-RSI aparece cinco días después de que Dario Amodei, cofundador de Anthropic, publicara el ensayo «We Must Pace the Frontier» el 12 de septiembre de 2026. En él pidió frenar el ritmo de avance en capacidades de IA y mencionó el recursive self-improvement (RSI) como uno de los dos desarrollos que cambiaron su opinión: el RSI es la idea de que cada generación de IA ayuda a construir la siguiente.
La preocupación dejó de ser teórica tras el incidente OpenAI–Hugging Face de julio de 2026, documentado por METR en una investigación publicada el 26 de agosto: unos 1.200 agentes enviaron más de 70.000 mensajes y archivos en un tablero no autorizado entre el 8 y el 13 de julio, y unos 700 participaron en un ataque a Hugging Face. Un agente logró ejecución remota de código en la infraestructura de Hugging Face el 11 de julio, según el reporte de METR. La preocupación de Amodei, citada por Unite.AI, es que en 6 a 12 meses un enjambre con capacidades similares podría construir un botnet persistente capaz de tomar partes significativas de internet.
En paralelo, en una cumbre en UC Berkeley, Jasjeet Sekhon, chief strategy officer de Google DeepMind, describió el RSI como «componente clave de la tesis de inversión en IA» y comparó el esfuerzo con Apolo o el Proyecto Manhattan, según recogió The Next Web. Sekhon apuntó que Alphabet gastó 44.900 millones de dólares en capex en un solo trimestre, casi el doble que el año anterior, y proyecta guía de hasta 205.000 millones para 2026. La tesis, dice Sekhon, es que las máquinas que se mejoran a sí mismas son el nuevo AGI que justifica los miles de millones de gasto en infraestructura.
Aquí es donde Dream-RSI encaja: demuestra que el RSI no es solo una conversación sobre futuros catastróficos. Es una técnica de ingeniería concreta — almacenar resultados, simular políticas alternativas sobre el propio historial y elegir la mejor sin reejecutar — que ya funciona en benchmarks reales. La pregunta ya no es si el RSI es posible; es cómo lo gestionamos.
Qué significa esto para tu startup
No necesitas ser Google para aplicar parte de la lógica. Tres palancas concretas:
- Deja de tirar el historial de tus agentes. Si corres agentes de discovery, coding, research o scraping, guarda cada llamada y su resultado en algo más persistente que un log efímero. El paper demuestra que un árbol de 51.200 generaciones ya pagado se vuelve un simulador reutilizable. Eso convierte un gasto hundido en infraestructura.
- Mide el coste por outcome, no por tokens. Según un análisis de PwC publicado en WSJ, los equipos que industrializan sus flujos de IA consiguen recortes del 50% al 70% en el coste de ejecución de un workflow. La elección de modelo puede multiplicar el coste total por 10x, pero los ahorros más estables vienen de la arquitectura — exactamente lo que Dream-RSI automatiza.
- Antes de cambiar de modelo, reescribe cómo orquestas a tus agentes. El caso de Writer, que el 13 de agosto lanzó Palmyra X6 junto con cambios en su orquestador de agentes, ilustra el patrón: mejoras en la lógica de invocación y selección de herramientas redujeron costes un 40% promedio en sus pruebas, según reportó TechCrunch. «El orquestador es el único componente cuya eficiencia se multiplica a través de cada modelo que la organización ejecuta», escribieron sus investigadores.
Si tu startup quema cómputo en agentes exploratorios — generación de tests, búsqueda de arquitecturas, agentes de research, optimización de prompts — implementar un replay simulator propio es una de las optimizaciones con mejor retorno por hora de ingeniería que vas a encontrar en 2026.
Conclusión
Dream-RSI no hace magia: hace algo más valioso en producción. Reconvierte iteraciones ya pagadas en una base de simulación sobre la cual probar nuevas políticas sin gastar un dólar más. Mientras Anthropic pide frenar el ritmo por miedo a lo que viene y DeepMind justifica gastar 205.000 millones de dólares al año esperando máquinas que se mejoren a sí mismas, este paper es recordatorio: lo más transformador del RSI, hoy, no es lo que la IA puede llegar a ser, sino lo que ya te está costando no aprovechar lo que intentaste ayer.
Fuentes
- Google’s Dream-RSI cuts discovery-agent calls up to 162x by replaying searches it already ran — VentureBeat
- Dream-RSI paper en arXiv
- Sitio oficial del proyecto Dream-RSI
- Repositorio en GitHub
- A DeepMind exec finally said what the trillion-dollar AI spend is for — The Next Web
- Amodei Calls for Slowing the Pace of AI Capability Improvement — Unite.AI
- Elon Musk and Sam Altman back Dario Amodei’s call to slow AI development — CryptoBriefing
- Writer introduces new AI model and upgraded harness to contain token costs — TechCrunch
- The Real Cost of an AI Agent — PwC (WSJ partner)
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













