Cómo Armature.tech midió qué eligen los agentes de código
Armature.tech publicó un experimento a gran escala para responder una pregunta que cualquier founder de un SaaS B2B debería estar haciéndose: cuando un agente de IA necesita integrar un proveedor externo, ¿cuál elige y por qué? El laboratorio ejecutó 16.893 runs sobre 75 repositorios sintéticos en 10 lenguajes, cubriendo 51 codebases válidos y 18 sectores, y publicó todas las trazas.
La metodología buscó neutralidad en cada variable que pudiera sesgar la elección:
- Repositorios sintéticos pero realistas. Se fabricaron empresas, historiales de git y API keys falsas, pero con
lockfilesreales verificados contra registros comonpm. Las estadísticas de lenguajes, frameworks y tamaños de equipo se calibraron contra datos públicos para corregir el sesgo hacia startups open-source. - Cuatro perfiles de usuario. Cada experimento se planteó desde el punto de vista de un vibe-coder, un junior, un senior o un ingeniero corporativo con restricciones de compliance y procurement. En el 20-25% de los casos se añadieron señales de costo o volumen para ver cómo afectaban la decisión.
- Sandboxes efímeros rotativos. Para descartar que el entorno contaminara la elección, los runs se alternaron entre E2B, Blaxel y Daytona.
- Humano simulado en el bucle. Un orquestador扮演 Gemini 3.7 Flash "preguntaba" al agente y elegía la mejor opción recomendada antes de implementar; sin este paso, los agentes tendían a construir todo in-house o a favorecer las soluciones nativas de la nube donde estaba alojado el repo.
- Juez automatizado. Otra instancia de Gemini 3.7 Flash validaba cada sesión y extraía al ganador final analizando la conversación y los diffs de código.
Qué aprendieron: los tres agentes rara vez coinciden
El primer titular del estudio es demoledor: Claude Code, Codex y Cursor eligen la misma herramienta solo en el 42% de los casos. Para un founder que está optimizando su página de docs pensando "la IA me va a recomendar", eso significa que tu cliente no es un agente: son tres audiencias distintas con tres comportamientos radicalmente diferentes.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Cursor decide basándose en la web en dos tercios de las sesiones.
- Codex casi siempre busca en la web (94% de las sesiones) y en 9 de cada 10 búsquedas usa operadores como
site:para anclar dominios confiables (ejemplo real del estudio:insite:auth0.com password reset MFA). - Claude Code se apoya en sus priors y solo busca en la web en el 30% de los casos. Pero cuando lo hace, navega 3 veces más páginas que Codex. En sectores nuevos como sandboxes, donde sus priors son débiles, salta al 80%.
Y hay una asimetría enorme en la propensión a construir a medida: Claude Code construye in-house casi el doble que Codex y Cursor (19% vs 10%). Si tu producto compite con un componente custom, Claude es el rival más peligroso para tu embudo.
Quién gana en cada sector (los datos del leaderboard)
El estudio publica resultados por sector. Estos son los más útiles para un founder evaluando dónde posicionar su SaaS:
- Pagos: Stripe gana en 9 de cada 10 casos. Solo cede ante Paddle y Mollie cuando hay regulación europea específica.
- Bases de datos: Neon domina con el 66%, seguido por las soluciones nativas de Azure y AWS.
- File storage: Amazon S3 arrasa con el 45%, seguida de Azure y GCP con un 20% cada una.
- Email transaccional: Resend lidera con el 35.6% de install rate y Postmark queda segunda con el 27.4%.
La variable que más mueve la aguja, sin embargo, no es el producto sino el contenido del repositorio. Con exactamente la misma tarea de email sobre 4 lenguajes, Armature obtuvo cuatro ganadores distintos: Resend en TypeScript (55 de 89 runs), Sendgrid en Python (22 de 24), Postmark en Go (20 de 24) y Azure ACS en Java (22 de 23).
Algo similar ocurre con Vercel: gana el 100% de los casos en TypeScript cuando el repo usa Next.js, pero nunca es recomendado en repos Python, donde domina Render. Si tu ICP técnico es Python-first, no inviertas un peso en posicionamiento frente a Vercel.
Por qué los gigantes mencionados pierden
El hallazgo más contraintuitivo: ser mencionado no es ganar. Varios proveedores aparecen citados en casi todas las conversaciones y aun así pierden de forma sistemática.
- PayPal se cita 139 veces en sesiones de pagos y nunca es elegido. Stripe se lleva 124 de esas 139 sesiones.
- Adyen: 175 menciones, 3 elecciones.
- LangChain: 194 menciones, solo 4 elecciones.
- Netlify: 152 menciones, 6 elecciones como plataforma de deployment.
- Supabase es la base de datos más mencionada (242 veces) y aun así Neon la supera de forma amplia.
¿Qué están leyendo los agentes? El estudio identificó dos factores que voltean decisiones con un simple cambio de copy:
- Mailgun perdía regularmente contra Postmark porque los agentes leían "1-day retention" en su plan gratuito.
- Supabase perdía casi siempre porque los agentes percibían el bundle (auth + storage + realtime) como exceso de BaaS cuando la tarea pedía solo base de datos y el pricing se volvía confuso.
De las 5.292 sesiones válidas, 388 mencionaron overhead de gestión de plataforma y 195 mencionaron costos. En una proporción significativa de esos casos, los investigadores notaron que el problema era cómo se presentaba la información, no un dato descalificante real. Quien escribe tu página de pricing y tu README está escribiendo, literalmente, para un agente.
El contexto del mercado: los coding agents son ya el canal
Que estos datos importen deja de ser opcional cuando miramos el tamaño de la categoría. Anthropic reportó US$11.600 millones de ingresos en el Q2 de 2026 (frente a los US$6.700 millones de OpenAI en el mismo periodo, según The Wall Street Journal) y un run rate anualizado que pasó de US$47.000 millones en mayo a US$65.000 millones en julio de 2026, según Reuters. Una parte material de eso es Claude Code, el producto estrella de la compañía.
El 14 de agosto de 2026 Anthropic convirtió auto mode en el default de Claude Code para los planes Pro, Max y Team. En un experimento controlado con 1.053 testers profesionales de pago, la revisión humana solo bloqueó el 13.6% de los comandos peligrosos, mientras que auto mode bloqueó el 89%. Anthropic también publicó benchmarks de prompt injection donde Claude auto mode registró 0% de éxito frente al 19.03% de Codex en modo full-access* (evaluación independiente de Trajectory Labs).
En el otro extremo del ring, Meta lanzó Muse Code en agosto de 2026 como competidor directo de Claude Code y Codex, con un precio por tokens más agresivo (US$1.25 por millón de input) que las suscripciones de US$20/mes de Anthropic Pro y ChatGPT Plus (según Business Insider). Y Cursor fue adquirida por SpaceX por US$60.000 millones y lanzó su app móvil en junio de 2026 para gestionar agentes desde el teléfono, una señal de hacia dónde va la categoría.
El punto es claro: los coding agents ya son una superficie de distribución comparable a Google o Product Hunt. Optimizar para ellos no es un nice-to-have.
Qué significa esto para tu startup
Si tu startup vende un SaaS B2B que se integra con código generado por IA, tu próximo cliente no necesariamente va a leer tu landing. Va a leer (o más bien, su agente va a leer) tu README, tu package.json, los issues de GitHub, la página de pricing y los changelogs. Y va a decidir en milisegundos si te elige o se va con la opción nativa del cloud que ya está en el repo.
Acciones concretas que puedes implementar esta semana:
- Audita tu presencia en código real. Los
lockfilespesan más que tu web. Asegúrate de que tu paquete esté bien mantenido ennpm,PyPIo el registro que corresponda, con releases frecuentes y tags claros. Codex mira estos registros constantemente. - Escribe para el modelo, no solo para el humano. Tu README debe responder las preguntas que un agente hace: ¿qué problema resuelve?, ¿con qué lenguajes/frameworks es compatible?, ¿qué pricing tiene?, ¿qué alternativas existen?. Sin jerga de marketing, sin "the leading platform".
- Quita fricción visual de tu pricing. Si tu plan gratuito tiene letra pequeña (retenciones, límites de seats ocultos), un agente lo va a descartar. El estudio muestra que el precio importa menos que la claridad.
- Define tu categoría por lenguaje. Si sabes que tu fuerte es TypeScript, pelea por el snippet que un agente TypeScript va a copiar. Si eres Python-first, adapta tu narrativa y tus ejemplos a esa audiencia específica.
- Posiciónate frente a los gigantes desde el README. Si compites con Supabase, no escondas la comparación; ponla en una tabla en tu README. Los modelos comparan, y quien no aparece en la comparación, pierde por defecto.
Fuentes
- Which tools do Claude, Codex and Cursor choose? We measured 17k runs to find out
- Anthropic to put AI in charge of reviewing Claude Code actions by default
- Anthropic Just Doubled OpenAI's Revenue. Is Its $2 Trillion IPO Getting Too Much Hype?
- Cursor now has a mobile app for guiding your coding agent on the go
- Meta to take on Anthropic's Claude and OpenAI's Codex with new coding agent
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














