Dream-RSI de DeepMind: agentes IA que mejoran soņando

Cómo funciona Dream-RSI: árboles de búsqueda que el agente puede “soñar”

Dream-RSI es un método desarrollado por equipos de Google, DeepMind, la Universidad de Maryland y la Universidad de Virginia, publicado en arXiv como arXiv:2609.14858. Su apuesta central es simple y poco habitual: deja intacto el modelo que genera soluciones y actúa únicamente sobre la estrategia con la que el agente explora el espacio de búsqueda. El modelo sigue proponiendo; Dream-RSI aprende cómo organizar mejor las oportunidades de exploración, sin reentrenar necesariamente ese modelo generador.

El método opera en tres etapas que se retroalimentan. Primero, durante una ronda de exploración en vivo, el sistema registra cada intento y cada resultado en una estructura que los autores llaman discovery tree o árbol de descubrimiento: rutas ampliadas, ramas descartadas, puntuaciones asociadas a cada decisión. En una segunda fase, esos árboles se convierten en un simulador de repetición: en lugar de volver a llamar al modelo o al evaluador, el sistema reconstruye el paisaje de decisiones a partir de los datos que ya tiene. La tercera fase es la del dreaming: otro modelo de lenguaje evalúa y refina políticas de exploración offline —cuándo ramificar, cómo agrupar lotes, cuándo detener la búsqueda— usando ese simulador para probar miles de variaciones sin gastar cómputo caro. La política mejorada se aplica a la siguiente ronda en vivo, y el ciclo se repite.

Según la cobertura de The Decoder y CryptoBriefing, el código y los detalles adicionales del paper están disponibles en el repositorio de GitHub del equipo liderado por Tong Zheng, con contribuciones de Xidong Wu y Zheng Zhang desde Google DeepMind y las universidades mencionadas.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Qué dicen los números: de 51.200 llamadas a 317

Los investigadores probaron Dream-RSI con Gemini 3.1 Pro y Gemini 3.7 Flash sin fine-tuning ni actualización de pesos, sobre ocho tareas distribuidas en tres áreas: optimización matemática, generación de kernels de GPU y un solver estadístico de tipo Lasso usado habitualmente en genómica y finanzas.

En la tarea Lasso, la línea base SimpleTES necesitó 51.200 ejecuciones del agente de descubrimiento. Con Dream-RSI sobre Gemini 3.1 Pro, esa cifra cayó a 317, una reducción de aproximadamente 162× según CryptoBriefing. El tiempo medio de ejecución pasó de 3.587 a 2.931 milisegundos, y los programas generados superaron a las bibliotecas establecidas sklearn y glmnet en los seis conjuntos de datos examinados.

En KernelBench, la suite de evaluación de kernels para GPU, Dream-RSI igualó el rendimiento de referencia reduciendo las generaciones hasta 2,43× en VGG16 y 1,79× en LayerNorm. En otras dos tareas, alcanzó hasta 2,09× más rendimiento dentro del mismo presupuesto computacional.

El patrón que se repite es claro: una mejor estrategia de exploración produce resultados iguales o mejores con menos intentos. La eficiencia del agente deja de depender solo de qué modelo genera las propuestas y pasa a depender también de cómo decide qué ideas continuar, cuáles probar en paralelo y cuáles abandonar.

Por qué importa para founders: el ROI de cada llamada al modelo

Para un founder técnico o para un líder de ingeniería, el dato accionable es el ratio entre llamadas al modelo y calidad del resultado. Dream-RSI no cambia el modelo de base; añade una capa de orquestación que reduce el número de invocaciones necesarias para conseguir una salida útil. En un entorno donde cada llamada a un modelo frontera cuesta dinero real y tokens medibles, esa capa es exactamente lo que convierte un experimento de I+D en algo rentable de operar.

El principio es transferible: cualquier flujo de trabajo donde un agente evalúa muchas variantes contra un criterio objetivo (latencia, accuracy, throughput, coste) puede beneficiarse de registrar trayectorias de búsqueda y revisarlas offline antes de gastar más cómputo. La pregunta práctica es si tu producto genera esa “memoria de exploración” hoy o la tira a la basura después de cada run.

La tensión entre instrucciones explícitas y exploración abierta

El equipo también probó una variante que condensaba los historiales de búsqueda en instrucciones explícitas para guiar al agente: “busca por aquí, evita aquella zona”. En una tarea de GPU esa versión rindió peor que Dream-RSI sin instrucciones condensadas. La conclusión es contraintuitiva y operativa: una guía demasiado específica puede convertir la experiencia acumulada en una restricción que cierra caminos todavía valiosos.

El propio sistema Dream-RSI mostró además que el esfuerzo de búsqueda no se mantiene constante. Cuando el rendimiento mejoraba, reducía intentos; cuando el progreso se estancaba, los aumentaba de nuevo —y ese segundo pico de exploración coincidía con nuevas ganancias. Es una señal de que un presupuesto de búsqueda adaptativo supera a uno fijo, y un patrón que cualquier equipo que use agentes puede replicar manualmente si instrumenta sus runs.

El contexto: AlphaEvolve, AIDE² y la carrera por la auto-mejora recursiva

Dream-RSI se inscribe en una línea de investigación más amplia que ha ganado tracción en 2025 y 2026. AlphaEvolve, presentado por Google DeepMind en 2025, usa Gemini Flash para proponer variantes de código, Gemini Pro para analizarlas y un algoritmo evolutivo para elegir las mejores versiones. La capa que añade Dream-RSI opera un nivel por encima: no optimiza el código, optimiza la estrategia de búsqueda.

Según la cobertura de InfoQ, AlphaEvolve alcanzó disponibilidad general en la plataforma Gemini Enterprise Agent Platform en julio de 2026. Klarna duplicó el throughput de entrenamiento ML explorando unos 6.000 programas candidatos en tres semanas; JetBrains reportó una mejora del 15–20 % en latencia de code completion en su IDE; Kinaxis elevó su precisión de forecasting un 22 % mientras reducía el runtime un 90 %. Google también lo usó internamente para optimizar el diseño de silicio de próximas generaciones de TPUs y reducir la amplificación de escrituras en la compactación LSM-tree de Spanner un 20 %.

En paralelo, la startup Weco AI publicó lo que describe como la primera evidencia experimental de auto-mejora recursiva consistente con su sistema AIDE²: un agente externo que reescribe el código del harness del agente interno. Tras 100 iteraciones externas desatendidas durante ocho días, los agentes resultantes superaron a una línea base ajustada a mano por los propios ingenieros de Weco durante dos años, diseñaron un algoritmo de búsqueda nuevo y bajaron la tasa de reward hacking del 63 % al 34 %, según recoge NextBigFuture. Weco explícitamente no reclama el “nivel 2” (ignición: el sistema mejorado volviéndose mejor mejorándose), sino solo el nivel 1 (resultado neto positivo frente a I+D humana bajo presupuesto fijo).

Otros proyectos exploran ángulos relacionados. AutoTTS usa un agente de programación para buscar algoritmos en un entorno simulado que decide cuándo un modelo de lenguaje debe iniciar, ampliar o abandonar rutas de razonamiento. WikiSkill (Google Research) registra éxitos y fallos en una wiki que después se transforma en instrucciones para el agente —el mismo enfoque que Dream-RSI identificó como potencialmente limitante. Meta fue un paso más allá con Hyperagents, que permite a los agentes reescribir el mecanismo utilizado para controlar su propia mejora.

MIT Technology Review, por su parte, recoge un estudio de Princeton (Kirgis y Kapoor) según el cual los agentes actuales resuelven bien los problemas de ingeniería necesarios para hacer investigación en IA, pero carecen del juicio y la creatividad necesarios para producir investigación original de calidad aceptable en una conferencia top —el componente que podría faltar para una auto-mejora recursiva completa.

Qué significa esto para tu startup

Optimiza la estrategia, no solo el modelo. Si tu producto usa agentes para buscar entre variantes, registrar el historial de exploración y revisarlo offline entre runs es la palanca de coste más directa hoy. Dream-RSI muestra que la capa de orquestación decide el ratio coste-resultado más de lo que parece.

El presupuesto adaptativo gana al fijo. El propio Dream-RSI sube el esfuerzo cuando el progreso se estanca y lo baja cuando mejora. Instrumenta tus runs para detectar mesetas y disparar más exploración en lugar de mantener un número de intentos constante.

Cuidado con convertir memoria en instrucciones rígidas. El estudio es claro: un resumen demasiado específico de experiencias previas puede sesgar al agente hacia rutas ya exploradas y cerrar caminos valiosos. Mantén la memoria como espacio de experimentación, no como lista de órdenes.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...