Cognition lanza SWE-2: rivaliza con GPT-6 Astra al 25% de su costo

Cognition lanza SWE-2 y se acerca a GPT-6 Astra al 25% de su costo

A dos días de cerrar una Serie E de más de US$2.000 millones a una valoración de US$48.000 millones, Cognition presentó este 10 de septiembre a SWE-2, su modelo de codificación más avanzado hasta la fecha. El modelo logra 50,0% en FrontierCode 1.1 Main, queda a menos de un punto de Fable 5.1 (50,9%) y a unos pocos puntos de GPT-6 Astra (53,3%), pero a una fracción del costo: 64% más barato que el primero y aproximadamente una cuarta parte del precio del segundo, según los datos publicados por la propia empresa en su blog técnico.

Para un founder, el dato relevante no es solo el ranking: es que Cognition está intentando romper el consenso de que el código de frontera es coto privado de Anthropic y OpenAI, al mismo tiempo que su run-rate de ingresos pasó de US$492 millones en mayo a casi US$900 millones actuales, según reportó la compañía en el anuncio de su Serie E.

Qué trae SWE-2 y en qué benchmarks compite

SWE-2 es un modelo post-entrenado desde Kimi K33, un modelo de 2,8 billones de parámetros que ya había pasado por un RL agresivo para tareas agentic. Cognition aplica encima una nueva receta de aprendizaje por refuerzo que entrena todos los niveles de esfuerzo (low, medium, high, max) en una sola corrida, ajustando la pendiente de la frontera precio-rendimiento.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Los números que Cognition publica para su modelo frente a la competencia son estos:

  • FrontierCode 1.1 Main: SWE-2 50,0% · SWE-1.7 42,0% · Grok 4.6 48,0% · Fable 5.1 50,9% · GPT-5.6 Sol 47,5% · GPT-6 Astra 53,3% · Kimi K3 44,2%.
  • DeepSWE 1.1: SWE-2 73,0% · Fable 5.1 67,4% · GPT-6 Astra 74,1% · SWE-1.7 37,7%.
  • Terminal-Bench 2.1: SWE-2 92,8% — el más alto del grupo.
  • Terminal-Bench 4: SWE-2 27,3% — lejos todavía de Fable 5.1 (55,8%) y GPT-6 Astra (57,9%), donde Cognition reconoce que el modelo todavía no compite en tareas largas de agente con shell pesado.

La lectura combinada: SWE-2 supera a SWE-1.7 y a Grok 4.6 en score y costo, iguala a GPT-5.6 Sol y a Fable 5/5.1 por una fracción de su precio, y se acerca a GPT-6 Astra a aproximadamente un cuarto del costo. Cognition también aclara que en Terminal-Bench 4 el modelo queda «a few points» de Astra pero a un cuarto de su precio, lo que convierte a SWE-2 en una opción interesante para flujos donde el costo por tarea pesa más que el último punto de precisión.

Por qué SWE-2 hace más con menos turnos

Más allá del benchmark, el cambio de comportamiento que Cognition destaca es el que más impacta en el día a día de un equipo que usa agentes de código. SWE-2 medium hace su primera edición real tras una mediana de 18 pasos, frente a los 48 pasos que necesitaba SWE-1.7 para la misma tarea. En FrontierCode 1.1 Main, SWE-2 medium alcanza un score más alto que SWE-1.7 usando 58% menos turnos y 81% menos de costo medio por tarea.

La razón, según Cognition, es que el modelo «lee menos y decide antes»: en lugar de explorar exhaustivamente todo el repositorio, identifica qué partes importan para la tarea y arranca a escribir antes. El equipo de Cognition reporta tres patrones conductuales que observaron al probar el modelo internamente:

  • Cobertura de tests: SWE-2 escribe pruebas end-to-end que detectan regresiones y casos borde con más fiabilidad que sus predecesores.
  • Recurso dentro de los límites del usuario: cuando una herramienta externa falla (por ejemplo, una integración MCP no disponible), SWE-2 reconstruye la información desde otras fuentes a las que ya tiene acceso, como el historial de un canal de Slack.
  • Disciplina de verificación: cuando se le cuestiona, re-deriva conclusiones en vez de re-afirmarlas; corre artefactos para juntar evidencia en lugar de confiar en la prosa.

Estos tres patrones son, en la práctica, los que separan a un agente útil de uno que sólo alucina respuestas con apariencia técnica.

El truco técnico: penalización de costo informada por la frontera Pareto

Lo que hace Cognitive distinto en el entrenamiento es cómo entrena los niveles de esfuerzo. En lugar de entrenar un experto por nivel (como hace Kimi K3) y luego consolidarlos, Cognition entrena todos los niveles en una sola corrida de RL, aplicando una penalización lineal de costo por nivel, calibrada a la pendiente local de la frontera precio-rendimiento del modelo base. Si la pendiente está bien puesta, el modelo aprende a moverse por la frontera completa en lugar de mejorar un solo punto.

Sobre esa base, Cognition añade tres mejoras que bajan el costo de servir el modelo en producción:

  • DSpark speculative decoding, con un draft model reentrenado en línea para mantener una tasa de aceptación alta a medida que el policy cambia durante el RL (aceptación un 15% más larga que su predecesor).
  • NVFP4 y FP8 con quantization-aware training, que ajustan la inferencia al entrenamiento y reducen el mismatch KL. Las capas MLA usan FP8 para K, Q, V y score; en SWE-1.7 el componente NoPE iba en FP8 y RoPE en BF16, lo que introducía más divergencia.
  • Flywheel de verificación: triples el número de entornos de RL, overlays de instruction-following, y reutilización de checkpoints previos de SWE-2 para endurecer los verificadores y evitar reward hacking por parte de un modelo base más resourceful como Kimi K3.

El resultado neto: SWE-2 corre con throughput similar a SWE-1.7 (que tenía cerca de un tercio de los parámetros del modelo base usado ahora) y menor divergencia inference–training.

El contexto competitivo: Cognition ya no es la apuesta outsider

El lanzamiento llega en un momento especialmente denso para el sector. En las dos semanas previas se habían presentado Fable 5.1 (Anthropic, 1 de septiembre) y GPT-6 Astra (OpenAI, 3 de septiembre), con precios idénticos de US$10/US$50 por millón de tokens de input/output y ventanas de contexto de ~1 millón de tokens. En Terminal-Bench 4, Fable 5.1 reporta 55,8% y GPT-6 Astra 57,9% — SWE-2 queda detrás ahí, pero gana en otras pruebas agentic y cobra mucho menos.

El movimiento de Cognition no se entiende sin la Serie E: con US$2.000 millones+ recaudados y un run-rate de ~US$900 millones, la empresa dejó de financiarse vendiendo acceso a modelos de terceros y pasó a construir los suyos propios sobre un modelo abierto (Kimi K33), con el objetivo declarado de operar como un «independent agent lab» que elige el mejor modelo por tarea. Entre sus clientes Cognition menciona a Nvidia, GE Aerospace, Citi, Mercedes-Benz y Modal Labs, y afirma que 89% del código que commitean sus propios ingenieros lo escribe Devin, según datos publicados en mayo de 2026.

Mientras tanto, el competidor Cursor habría acordado ser adquirido por SpaceX por US$60.000 millones tras alcanzar un run-rate anualizado de más de US$2.000 millones, según reportes de prensa.

Qué significa esto para tu startup

El lanzamiento de SWE-2 reordena dos decisiones que tenés que tomar en las próximas semanas: cómo entrenas a tus agentes de código y cuánto pagás por tarea. Tres acciones concretas:

  • Mide costo por tarea, no precio por token. Como muestran los datos de Fable 5.1 y GPT-6 Astra, ambos modelos cobran US$10/US$50 por millón de tokens, pero el costo real por tarea varía hasta 5x según la eficiencia de tokens y el uso de caché. SWE-2, en su horquilla media, ya viene con una penalización de costo durante el RL — vale la pena pedirle al proveedor el dato de «dólares por tarea resuelta» antes de comparar precios de lista.
  • Prueba Devin Web, Fusion y CLI si tu producto depende de Devin. SWE-2 ya está disponible en Devin Desktop y CLI, y Cognition lo está desplegando a Devin Web y Fusion de forma escalonada. Si tu equipo usa Devin para tareas largas de refactor, vale la pena pedir acceso temprano y comparar contra el modelo anterior en tu propio repositorio.
  • No sacrifiques el harness por el modelo. Los benchmarks de Cognition (FrontierCode 1.1) y de OpenAI (DeepSWE, Terminal-Bench) muestran que el «score» de un modelo cambia según el harness: Claude Code para Anthropic, Codex para OpenAI, Grok Build para xAI, Devin CLI para open-weight. Antes de cambiar de modelo, corré tu workload representativo en el harness que vas a usar realmente, porque el ranking puede invertirse.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...