Por qué los agentes de IA ya no escalan con la API de chat
El número promedio de agentes de IA activos por organización pasó de 5 a 13 entre febrero de 2025 y abril de 2026, según el 2026 Agentic Enterprise Index de Salesforce publicado por ZDNet. El tiempo medio para poner un agente en producción cayó 53%, hasta 1,9 días. La presión para escalar dejó de ser opcional: el 60% de los agentes empresariales están sobrepermisivados, según el reporte State of Agentic Adoption 2026 de Opsin Labs.
En ese contexto, AWS publicó el 18 de febrero una guía técnica para que las startups monten agentes de IA sobre arquitectura sin servidor. El artículo parte de una paradoja que cualquier founder reconoce: armar un primer prototipo con IA es casi tan fácil como llamar a una API de chat, pero llevar esa misma aplicación a producción exige una arquitectura bastante más compleja.
Qué componentes necesita una aplicación agéntica
La guía de AWS descompone la arquitectura en cuatro bloques que conviene tener claros antes de escribir una línea:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Modelo fundacional: un LLM accesible vía API. Amazon Bedrock ofrece Claude (Anthropic), Amazon Nova Sonic (voz) y modelos abiertos de OpenAI y Mistral bajo una API unificada.
- Marcos de software: abstracciones sobre las APIs del modelo. La guía menciona LangChain y Strands como opciones soportadas por AgentCore.
- Capa de datos: donde vive el contexto que se le pasa al modelo. Casi siempre incluye un almacén vectorial para búsqueda semántica (RAG).
- Runtime del agente: donde se ejecuta el código del agente. En producción, separado del proceso principal.
El propio artículo subraya que el código de un agente se vuelve "mucho más complejo que las simples llamadas a la API de chat del modelo" en cuanto se añade ingeniería de contexto, y que los agentes suelen necesitar ejecutarse de forma asincrónica fuera de la aplicación principal, especialmente cuando manejan información sensible.
Cómo encaja Amazon Bedrock AgentCore
Amazon Bedrock AgentCore es el componente central de la propuesta sin servidor de AWS para ejecutar agentes. En su lanzamiento original funcionaba sobre microVMs con sesiones de hasta 8 horas, según documenta InfoQ. En agosto de 2026, AWS añadió runtime instances: sesiones persistentes respaldadas por EC2 que pueden extenderse hasta 14 días, con sistema de archivos compartido, instancias aceleradas por GPU y soporte para Python e imágenes de contenedor, manteniendo las mismas APIs, identidad y observabilidad que las microVMs.
Según el análisis de InfoQ, el break-even entre runtime instances y microVMs se sitúa cerca del 24% de utilización sostenida de CPU, antes de aplicar Savings Plans. Para tráfico corto y en ráfagas, las microVMs siguen siendo la opción más barata; para trabajos largos, con estado o que requieren GPU, las runtime instances ahorran tener que mantener una flota de EC2 separada.
El flujo típico que describe la guía:
- Empaquetar el agente (zip en S3 o imagen de contenedor en ECR).
- Configurar AgentCore para ejecutarlo en la nube.
- AgentCore gestiona autenticación (IAM o JWT), observabilidad y escalado sin que el desarrollador toque un servidor.
Marcos soportados: LangChain y Strands según la guía original; InfoQ amplía la lista a CrewAI, LangGraph y LlamaIndex en el contexto de runtime instances.
La capa de datos: Knowledge Bases y S3 Vectors
Para alimentar el contexto de los agentes, AWS propone Knowledge Bases de Amazon Bedrock combinado con Amazon S3 Vectors, una base de datos vectorial sin servidor integrada en S3. El servicio se encarga del pipeline completo: trocear documentos, generar embeddings, almacenar y relacionar fragmentos con sus vectores para responder consultas semánticas. Esto es lo que la guía llama RAG (generación aumentada por recuperación).
El ejemplo que da AWS: un agente de atención al cliente que necesita responder "¿Cómo cambio la dirección asociada a mi cuenta?" toma los documentos de FAQ desde S3, los indexa en una Knowledge Base y devuelve solo los fragmentos relevantes al prompt, sin que el equipo arme manualmente la infraestructura de búsqueda semántica.
El problema real: gobernanza, no solo infraestructura
Escalar agentes no es solo desplegar más compute. El reporte de Opsin Labs (publicado el 5 de agosto de 2026) encontró que las empresas hoy promedian un agente por empleado, y que el 67% de esos agentes los construyen personas sin background de ingeniería — equipos de GTM, Customer Success u Operaciones. El 60% de los agentes con permisos configurados más allá del default recibieron acceso "allow-all" en lugar de permisos acotados a su tarea.
En esa misma línea, AWS trabaja con vendors de seguridad para cerrar la brecha. El 17 de junio de 2026, en el AWS Summit de Nueva York, Rubrik anunció la integración de Rubrik Agent Cloud con AgentCore para llevar controles en tiempo real al gateway del agente. El 1 de julio, Netzilo amplió su plataforma de gobernanza AIDR para AgentCore y otros runtimes como Microsoft Foundry, CrewAI o Vertex AI. El mensaje del sector es claro: desplegar agentes sin definir intención, contexto y permisos a nivel runtime ya se considera un riesgo operativo, no solo una buena práctica.
¿Qué significa esto para tu startup?
Si estás construyendo o vendes agentes de IA, la conversación con tu cliente técnico ya no puede quedarse en "uso Claude". Tienes que poder dibujar la arquitectura en cinco minutos: qué modelo, qué vector store, qué runtime, qué framework y qué capa de gobernanza. AWS acaba de poner sobre la mesa un stack sin servidor que cubre los cuatro primeros puntos y empuja a los vendors de seguridad a cubrir el quinto.
Tres acciones concretas para esta semana:
- Mapea tu stack actual contra Bedrock + AgentCore. Si hoy ejecutas agentes en EC2 o Fargate, calcula si te conviene migrar a las microVMs de AgentCore (tráfico corto) o a las runtime instances (procesos largos). El umbral orientativo de InfoQ es 24% de utilización sostenida de CPU antes de descuentos.
- Si dependes de LangChain o Strands, valida el empaquetado. La guía de AWS confirma el soporte de ambos frameworks vía zip en S3 o contenedor en ECR, sin reescribir el código del agente.
- Revisa tu elegibilidad para AWS Activate. La guía recuerda que AWS Activate ha repartido más de US$8.000 millones en créditos desde 2013. Esos créditos cubren Bedrock, S3, AgentCore y el resto de servicios descritos en el artículo, y son especialmente relevantes para founders en LATAM y España donde el acceso a cloud credits acelera los primeros seis meses de producto.
Fuentes
- Creación de agentes de IA que escalan: arquitectura sin servidor en AWS — fuente original
- Multi Agent Collaboration Gets Persistent Compute in Bedrock AgentCore — InfoQ, agosto de 2026
- Business adoption of AI agents tripled this year – as measurable ROI emerges — ZDNet sobre el 2026 Agentic Enterprise Index de Salesforce
- Opsin Labs Report: 60% of Enterprise AI Agents Are Over-Permissioned as Adoption Accelerates 14x — Opsin Labs State of Agentic Adoption 2026, agosto de 2026
- Rubrik Announces Upcoming Integration with Amazon Bedrock AgentCore to Secure AI Agents — AWS Summit, junio de 2026
- Netzilo adds runtime governance for AI agents across major platforms — Help Net Security, julio de 2026
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













