Claude, Codex y Cursor: 16.893 tests revelan qué eligen

Cómo Armature.tech midió qué eligen los agentes de código

Armature.tech publicó un experimento a gran escala para responder una pregunta que cualquier founder de un SaaS B2B debería estar haciéndose: cuando un agente de IA necesita integrar un proveedor externo, ¿cuál elige y por qué? El laboratorio ejecutó 16.893 runs sobre 75 repositorios sintéticos en 10 lenguajes, cubriendo 51 codebases válidos y 18 sectores, y publicó todas las trazas.

La metodología buscó neutralidad en cada variable que pudiera sesgar la elección:

  • Repositorios sintéticos pero realistas. Se fabricaron empresas, historiales de git y API keys falsas, pero con lockfiles reales verificados contra registros como npm. Las estadísticas de lenguajes, frameworks y tamaños de equipo se calibraron contra datos públicos para corregir el sesgo hacia startups open-source.
  • Cuatro perfiles de usuario. Cada experimento se planteó desde el punto de vista de un vibe-coder, un junior, un senior o un ingeniero corporativo con restricciones de compliance y procurement. En el 20-25% de los casos se añadieron señales de costo o volumen para ver cómo afectaban la decisión.
  • Sandboxes efímeros rotativos. Para descartar que el entorno contaminara la elección, los runs se alternaron entre E2B, Blaxel y Daytona.
  • Humano simulado en el bucle. Un orquestador扮演 Gemini 3.7 Flash "preguntaba" al agente y elegía la mejor opción recomendada antes de implementar; sin este paso, los agentes tendían a construir todo in-house o a favorecer las soluciones nativas de la nube donde estaba alojado el repo.
  • Juez automatizado. Otra instancia de Gemini 3.7 Flash validaba cada sesión y extraía al ganador final analizando la conversación y los diffs de código.

Qué aprendieron: los tres agentes rara vez coinciden

El primer titular del estudio es demoledor: Claude Code, Codex y Cursor eligen la misma herramienta solo en el 42% de los casos. Para un founder que está optimizando su página de docs pensando "la IA me va a recomendar", eso significa que tu cliente no es un agente: son tres audiencias distintas con tres comportamientos radicalmente diferentes.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Cursor decide basándose en la web en dos tercios de las sesiones.
  • Codex casi siempre busca en la web (94% de las sesiones) y en 9 de cada 10 búsquedas usa operadores como site: para anclar dominios confiables (ejemplo real del estudio: insite:auth0.com password reset MFA).
  • Claude Code se apoya en sus priors y solo busca en la web en el 30% de los casos. Pero cuando lo hace, navega 3 veces más páginas que Codex. En sectores nuevos como sandboxes, donde sus priors son débiles, salta al 80%.

Y hay una asimetría enorme en la propensión a construir a medida: Claude Code construye in-house casi el doble que Codex y Cursor (19% vs 10%). Si tu producto compite con un componente custom, Claude es el rival más peligroso para tu embudo.

Quién gana en cada sector (los datos del leaderboard)

El estudio publica resultados por sector. Estos son los más útiles para un founder evaluando dónde posicionar su SaaS:

  • Pagos: Stripe gana en 9 de cada 10 casos. Solo cede ante Paddle y Mollie cuando hay regulación europea específica.
  • Bases de datos: Neon domina con el 66%, seguido por las soluciones nativas de Azure y AWS.
  • File storage: Amazon S3 arrasa con el 45%, seguida de Azure y GCP con un 20% cada una.
  • Email transaccional: Resend lidera con el 35.6% de install rate y Postmark queda segunda con el 27.4%.

La variable que más mueve la aguja, sin embargo, no es el producto sino el contenido del repositorio. Con exactamente la misma tarea de email sobre 4 lenguajes, Armature obtuvo cuatro ganadores distintos: Resend en TypeScript (55 de 89 runs), Sendgrid en Python (22 de 24), Postmark en Go (20 de 24) y Azure ACS en Java (22 de 23).

Algo similar ocurre con Vercel: gana el 100% de los casos en TypeScript cuando el repo usa Next.js, pero nunca es recomendado en repos Python, donde domina Render. Si tu ICP técnico es Python-first, no inviertas un peso en posicionamiento frente a Vercel.

Por qué los gigantes mencionados pierden

El hallazgo más contraintuitivo: ser mencionado no es ganar. Varios proveedores aparecen citados en casi todas las conversaciones y aun así pierden de forma sistemática.

  • PayPal se cita 139 veces en sesiones de pagos y nunca es elegido. Stripe se lleva 124 de esas 139 sesiones.
  • Adyen: 175 menciones, 3 elecciones.
  • LangChain: 194 menciones, solo 4 elecciones.
  • Netlify: 152 menciones, 6 elecciones como plataforma de deployment.
  • Supabase es la base de datos más mencionada (242 veces) y aun así Neon la supera de forma amplia.

¿Qué están leyendo los agentes? El estudio identificó dos factores que voltean decisiones con un simple cambio de copy:

  • Mailgun perdía regularmente contra Postmark porque los agentes leían "1-day retention" en su plan gratuito.
  • Supabase perdía casi siempre porque los agentes percibían el bundle (auth + storage + realtime) como exceso de BaaS cuando la tarea pedía solo base de datos y el pricing se volvía confuso.

De las 5.292 sesiones válidas, 388 mencionaron overhead de gestión de plataforma y 195 mencionaron costos. En una proporción significativa de esos casos, los investigadores notaron que el problema era cómo se presentaba la información, no un dato descalificante real. Quien escribe tu página de pricing y tu README está escribiendo, literalmente, para un agente.

El contexto del mercado: los coding agents son ya el canal

Que estos datos importen deja de ser opcional cuando miramos el tamaño de la categoría. Anthropic reportó US$11.600 millones de ingresos en el Q2 de 2026 (frente a los US$6.700 millones de OpenAI en el mismo periodo, según The Wall Street Journal) y un run rate anualizado que pasó de US$47.000 millones en mayo a US$65.000 millones en julio de 2026, según Reuters. Una parte material de eso es Claude Code, el producto estrella de la compañía.

El 14 de agosto de 2026 Anthropic convirtió auto mode en el default de Claude Code para los planes Pro, Max y Team. En un experimento controlado con 1.053 testers profesionales de pago, la revisión humana solo bloqueó el 13.6% de los comandos peligrosos, mientras que auto mode bloqueó el 89%. Anthropic también publicó benchmarks de prompt injection donde Claude auto mode registró 0% de éxito frente al 19.03% de Codex en modo full-access* (evaluación independiente de Trajectory Labs).

En el otro extremo del ring, Meta lanzó Muse Code en agosto de 2026 como competidor directo de Claude Code y Codex, con un precio por tokens más agresivo (US$1.25 por millón de input) que las suscripciones de US$20/mes de Anthropic Pro y ChatGPT Plus (según Business Insider). Y Cursor fue adquirida por SpaceX por US$60.000 millones y lanzó su app móvil en junio de 2026 para gestionar agentes desde el teléfono, una señal de hacia dónde va la categoría.

El punto es claro: los coding agents ya son una superficie de distribución comparable a Google o Product Hunt. Optimizar para ellos no es un nice-to-have.

Qué significa esto para tu startup

Si tu startup vende un SaaS B2B que se integra con código generado por IA, tu próximo cliente no necesariamente va a leer tu landing. Va a leer (o más bien, su agente va a leer) tu README, tu package.json, los issues de GitHub, la página de pricing y los changelogs. Y va a decidir en milisegundos si te elige o se va con la opción nativa del cloud que ya está en el repo.

Acciones concretas que puedes implementar esta semana:

  • Audita tu presencia en código real. Los lockfiles pesan más que tu web. Asegúrate de que tu paquete esté bien mantenido en npm, PyPI o el registro que corresponda, con releases frecuentes y tags claros. Codex mira estos registros constantemente.
  • Escribe para el modelo, no solo para el humano. Tu README debe responder las preguntas que un agente hace: ¿qué problema resuelve?, ¿con qué lenguajes/frameworks es compatible?, ¿qué pricing tiene?, ¿qué alternativas existen?. Sin jerga de marketing, sin "the leading platform".
  • Quita fricción visual de tu pricing. Si tu plan gratuito tiene letra pequeña (retenciones, límites de seats ocultos), un agente lo va a descartar. El estudio muestra que el precio importa menos que la claridad.
  • Define tu categoría por lenguaje. Si sabes que tu fuerte es TypeScript, pelea por el snippet que un agente TypeScript va a copiar. Si eres Python-first, adapta tu narrativa y tus ejemplos a esa audiencia específica.
  • Posiciónate frente a los gigantes desde el README. Si compites con Supabase, no escondas la comparación; ponla en una tabla en tu README. Los modelos comparan, y quien no aparece en la comparación, pierde por defecto.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...