Cognition lanza SWE-2: casi a la frontera del coding con 64% menos costo
Cognition, la startup detrás del agente de ingeniería Devin, presentó SWE-2 con una promesa incómoda para Anthropic y OpenAI: 50.0 en su propio benchmark FrontierCode 1.1 Main — a un punto de Claude Fable 5.1 y a 3.3 puntos de GPT-6 Astra, según datos publicados por la propia compañía. La cifra más alta de la tabla, eso sí, la obtiene en Terminal-Bench 2.1, donde SWE-2 marca 92.8 y supera a ambos rivales. Todo esto, sostiene Cognition, a un costo declarado 64% inferior al de Fable 5.1 y alrededor de una cuarta parte del precio de GPT-6 Astra.
Para un founder que ya paga varios miles de dólares al mes por tokens de coding, esa diferencia de precio no es marginal: redefine qué tareas se pueden delegar a un agente sin pensarlo dos veces.
Qué hay bajo el capó: Kimi K3 con el RL de Cognition encima
SWE-2 es 2.8 billones de parámetros totales con 104.000 millones activos por token (arquitectura MoE). La base no es propia: es Kimi K3, el modelo abierto de Moonshot AI con 2,88 billones de parámetros y ventana de contexto de un millón de tokens que Geeky Gadgets describió como el modelo open-source más grande liberado hasta la fecha. Moonshot ya había entrenado K3 con mucho refuerzo para coding; el RL adicional de Cognition añade, según la propia empresa, 5 a 6 puntos extra en casi todos los benchmarks.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadNo es la primera vez que Cognition hace esto: SWE-1.7 ya estaba construido sobre Kimi K2.7 Code. El patrón — tomar un base chino abierto y especializado, y aplicar post-training propio para software engineering real — se repite y se acelera.
El serving stack es la otra mitad del ahorro. Cognition corre inferencia MoE sobre kernels NVFP4 y FP8 con quantization-aware training. FP8 carga K, Q, V y los cómputos de score en las capas MLA. Un draft model reentrenado con SpecForge gana 15% más accept length, y un prefill delayer sube TPM por GPU y tokens/segundo por request entre 10% y 20% — a costa de peor TTFT, como aclara la propia documentación.
Effort levels: por qué medium le gana a SWE-1.7 con la mitad de turnos
Una de las contribuciones técnicas que Cognition destaca es entrenar tres niveles de esfuerzo — medium, high y max — en un solo run de RL, en lugar de modelos separados para respuestas rápidas vs. profundas. El resultado es que la curva costo-rendimiento sube entera, no un punto a la vez.
Los números de uso, según Cognition:
- Pasos medios por run: 53 (medium), 80 (high), 98 (max) — frente a los 127 de SWE-1.7.
- Medium iguala o supera el score de SWE-1.7 en FrontierCode con 58% menos turnos y 81% menos costo promedio.
- El primer edit real llega en una mediana del step 18 — SWE-1.7 necesitaba el step 48, lo que explica por qué tantos usuarios se quejaban de que Devin «sobre-exploraba» tareas simples.
Para un founder, esto significa que el agente deja de quemar tokens y minutos antes de tocar el código.
El talón de Aquiles: Terminal-Bench 4.0
La tabla publicada por Cognition no es todo victoria. En Terminal-Bench 4.0 (trabajo agéntico de horizonte largo), SWE-2 marca 27.3 — muy por detrás de Fable 5.1 (55.8) y GPT-6 Astra (57.9). El hueco es grande, y Cognition no lo oculta: en tareas donde el agente debe sostener planes largos, explorar repositorios enormes y coordinarse a sí mismo, la frontera todavía está en otro lado. Para un equipo que delega refactors de semanas, esto importa.
El contexto sectorial: Cognition a US$48B y la fiebre del coding agent
El anuncio de SWE-2 llega una semana después de la Serie E de Cognition: más de US$2.000 millones levantado a una valuación de US$48.000 millones, según Unite.ai. El run rate de ingresos pasó de US$492M en mayo a cerca de US$900M actuales, según datos de la propia compañía. Clientes nombrados: Nvidia (chip design), GE Aerospace, Citi, Mercedes-Benz y Modal.
El competidor directo, Cursor, estaba negociando una ronda a aproximadamente US$50.000 millones antes de aceptar la adquisición de SpaceX por US$60.000 millones, con un ARR superior a los US$2.000 millones al momento de las conversaciones, según American Bazaar. Se espera que Cognition cierre el año entre US$4.000M y US$5.000M de ARR y Cursor alrededor de US$6.000M.
El patrón de construcción sobre bases chinas abiertas no es exclusivo de Cognition: American Bazaar lo enmarca como parte de una tendencia más amplia de laboratorios que toman pesos abiertos y atacan el pricing de la frontera. DeepSeek V4.1 Flash aparece citado en la misma conversación como competidor directo en precio.
Moonshot, por su parte, ha levantado más de US$5.500 millones y estaba valorada en US$30.000 millones en junio, con conversaciones de IPO en Hong Kong junto a Goldman Sachs, según New York Post.
Acceso y precio: qué puedes hacer hoy
SWE-2 no tiene pesos abiertos — es propietario. No hay descarga, no hay quant ladder. Cognition tampoco publica una API por token: la única superficie de pricing son comparativas de costo-por-tarea frente a Fable 5.1 y GPT-6 Astra. El modelo está disponible desde hoy en Devin Desktop, CLI, Web y Fusion, según el anuncio oficial recogido por OfficeChai.
Todos los benchmarks anteriores son auto-reportados por Cognition y pendientes de replicación independiente.
Qué significa esto para tu startup
Tres lecturas prácticas para un founder técnico que ya usa (o evalúa) agentes de coding:
- Coste-por-tarea, no por token, es la nueva unidad de cuenta. Si Cognition tiene razón y el delta real es 64%–75% frente a la frontera, tareas que hoy descartas por precio — refactors, migraciones, generación masiva de tests — entran en presupuesto. Acción concreta: audita los últimos 30 días de uso de Devin o Cursor y modela qué tareas adicionales podrías delegar con un costo-por-tarea 60% menor.
- El horizonte largo sigue siendo territorio frontier. El 27.3 en Terminal-Bench 4.0 es una señal honesta: para refactors que cruzan múltiples servicios o migraciones de un mes, todavía necesitas modelo top-tier o intervención humana senior. Acción concreta: segmenta tu backlog entre tickets corto-horizonte (delegables al agente) y trabajo multi-semana (revisión humana obligatoria).
- La dependencia de bases chinas abiertas es estructural, no coyuntural. Cognition, Cursor y otros están montando sobre K2.7, K3 y V4.1 Flash. Si tu roadmap depende de uno de estos modelos abiertos, conviene tener plan B: o un segundo proveedor, o un wrapper agnóstico. Acción concreta: documenta qué modelo base corre bajo tus agentes actuales y evalúa la migración a LM Studio Bionic o a otra superficie que te permita cambiar de base sin reescribir integraciones.
Fuentes
- Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1 — TokenStead
- Cognition Releases SWE-2, Says It Performs Close To Frontier At 70% Lower Cost — OfficeChai
- Cognition raises $2 billion as AI coding startup hits $48 billion valuation — American Bazaar
- Cognition Raises Over $2B Series E at $48B Valuation to Scale Devin Agents — Unite.ai
- 2.88 Trillion Parameter Kimi K3 Largest Open Model is Now Available — Geeky Gadgets
- LM Studio Bionic adds support for Moonshot AI's Kimi K3 model — 9to5Mac
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













