Sakana AI y MIT: SIFT evalúa coding agents 10x más barato

Un LLM como juez para que los coding agents se mejoren solos (10x más barato)

Evaluar un coding agent que se reescribe a sí mismo puede costar miles de dólares y consumir miles de horas de CPU. SIFT, el nuevo framework de investigadores del MIT y de Sakana AI (el laboratorio japonés conocido por sus métodos de búsqueda evolutiva), ataca exactamente ese cuello de botella: usa un segundo modelo de lenguaje como juez para comparar candidatos antes de gastar en benchmarks completos. El resultado, según los autores: 35,1% de accuracy en Polyglot en menos de cinco horas de reloj, con apenas 42 horas-CPU y cerca de US$150 en créditos de API usando el modelo cerrado o3-mini. Con el modelo open-weight Qwen3-Coder-30B, una corrida completa terminó en 224 horas-CPU y aproximadamente US$34 en API, alrededor de una décima parte de lo que consume la Darwin Gödel Machine (DGM), el enfoque anterior del propio Sakana, según reportó Crypto Briefing.

El paper, titulado Recursive Self-Improvement via Fast Tree Search y publicado en arXiv en septiembre de 2026, está firmado por Xinghong Fu (MIT), Aravinth Kulanthaivelu y Yutaro Yamada, con Sakana AI como laboratorio colaborador.

El problema: cada parche candidato es caro de verificar

Los coding agents auto-mejorables (como Claude Code, Codex o los que ya corren en producción) proponen cambios a sus propios prompts, herramientas o código. Decidir qué cambios conservar exige correr benchmarks, y cada benchmark cuesta. En el desglose del paper:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Proponer un parche: ~US$0,12
  • Una llamada del juez LLM: ~US$0,044 (SIFT hace hasta 10 por candidato, ~US$0,44)
  • Evaluar un agente en 50 tareas de Polyglot: ~US$6 y 2,6 horas-CPU

Un parche es barato, pero cuando la búsqueda genera decenas o cientos de candidatos, el costo se dispara. Y la señal de tests pequeños puede ser engañosa: el agente puede haber tenido suerte con problemas fáciles o haberse topado con un problema especialmente difícil.

Cómo funciona SIFT: juez por pares + ranking asíncrono

SIFT se apoya en la harness de la Darwin Gödel Machine, publicada por Sakana AI previamente, pero le inserta una fuente de feedback más barata: un LLM juez que compara dos implementaciones del agente en vez de pedir un puntaje absoluto. Es el patrón conocido como LLM-as-a-judge (modelo de lenguaje como juez), que en tareas de selección pareada suele correlacionar mejor con el rendimiento real que un puntaje aislado.

El flujo de SIFT:

  1. SIFT genera un agente modificado y lo prueba en 4 tareas de coding. Es un filtro rápido para descartar cambios que rompen al agente antes de gastar más.
  2. Un LLM juez compara ese candidato, en pares, con hasta 10 agentes del archivo de mejores versiones. El juez ve el código, no los resultados de los benchmarks.
  3. Las comparaciones se combinan con un modelo de Bradley–Terry, un método estadístico usado para ranking a partir de victorias y derrotas, que produce un orden de preferencia.
  4. El ranking se cruza con la accuracy en el set de búsqueda y se forma una cola de prioridad para la evaluación costosa.
  5. Todo corre en paralelo: la generación de parches, el juicio y la evaluación costosa avanzan a la vez, como un pipeline de CI.

El truco de fondo es la asincronía: una candidata prometedora puede seguir generando parches hijos mientras su benchmark completo todavía corre. El árbol de búsqueda no espera a cada evaluación.

Los números: SIFT vs DGM vs HGM

Los autores probaron SIFT sobre tres benchmarks con distintos modelos:

  • Polyglot: con o3-mini, SIFT alcanzó 35,1% en 30 pasos de expansión, frente al 30,7% de DGM (que necesitó 80 nodos). Sin el LLM juez, SIFT se quedó en 29,8%; el juez aporta la mayor parte de la ganancia.
  • TerminalBench 2.1: el agente que el juez eligió promedió 36,7% en corridas completas del benchmark, frente al 28,1% del que había ganado el set de búsqueda con 19 de 50 tareas. La línea base estaba en 29,2%, una mejora de 7,5 puntos. El juez detectó problemas que el test pequeño no veía, como un verificador deshabilitado por defecto y un shell reescrito con riesgo de runtime.
  • SWE-bench Verified (subset de 60 tareas): los dos agentes seleccionados por juez promediaron 50,4% y 53,8%, contra 44,6% y 50,4% sin juez. La línea base (el agente inicial) marcaba 40,0%.

Un caso particular: el Nodo 9, un candidato simple que solo añadía la instrucción «corre tests después de editar» y una herramienta test_runner que devuelve fallos estructurados. Un descendiente posterior le agregó más maquinaria. Ambos resolvían 44% de las tareas del set pequeño, así que el test no podía distinguirlos. En el Polyglot completo, el simple sacó 35,6% y el elaborado 33,8%; el juez ya había puesto al simple por encima solo leyendo el código.

Contexto: la línea evolutiva de Sakana y el auge de las harnesses auto-mejorables

SIFT no llega en el vacío. Es la tercera generación de un linaje abierto por Sakana AI:

  • Darwin Gödel Machine (DGM): mantiene un archivo de agentes y los evalúa en sets crecientes (10 tareas, 50, Polyglot completo al final).
  • Huxley-Gödel Machine (HGM): añade descendientes al cálculo y muestrea dinámicamente el tamaño del set de evaluación.
  • SIFT: añade el juez LLM y paraleliza el pipeline.

Sakana, con sede en Tokio, ha hecho de la búsqueda evolutiva una seña de identidad frente al «tirar más hardware al problema». Y el terreno se está moviendo rápido: en junio de 2026, el laboratorio GEAR de Nvidia, junto a CMU y UC Berkeley, presentó ENPIRE, una harness que dejó a coding agents (Codex con GPT-5.5, Claude Code con Opus 4.7, Kimi Code con K2.6) entrenando robots durante la noche, según reportó Ars Technica. En agosto de 2026, Prime Intellect liberó como open source Prime Agent, una harness auto-modificable que reportó 95,5% en ARC-AGI-3.

El denominador común: el cuello de botella ya no es el modelo, es la harness que lo envuelve y, sobre todo, cómo evaluarla de forma barata.

Qué significa esto para tu startup

Tres palancas concretas si tu equipo ya usa coding agents o está cerca de adoptarlos:

  • Mide el costo real de tu loop de evaluación hoy. Si ya corres benchmarks cada vez que tocas un prompt o una tool, multiplica eso por las decenas de candidatos que un self-improving agent genera por hora. La cifra que asusta (US$6 por evaluación de 50 tareas en el paper) se queda corta cuando los candidatos son cientos.
  • Separa la «puerta rápida» de la «puerta costosa». SIFT corre 4 tareas baratas para descartar cambios rotos antes de gastar. Adopta el patrón: define un set mínimo representativo de tu propio producto (no de benchmarks públicos) que falle ruidosamente cuando un cambio rompe una invariante.
  • No necesitas la implementación completa de SIFT para empezar. El paper no publica el código como producto standalone, pero se monta sobre la harness de DGM, que ya es open source. El atajo es tomar DGM, añadirle un juez LLM barato (incluso un modelo open-weight pequeño sirve para el grueso de las comparaciones) y paralelizar las evaluaciones con un worker queue.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...