El 59% de empresas no diagnostica fallos de IA: el reto de la fábrica

Por qué los agentes de IA no pueden arreglar lo que no saben diagnosticar

El 59% de las empresas estadounidenses y el 53% de las británicas no pueden identificar automáticamente la causa raíz de un fallo en su infraestructura de IA cuando éste cruza varios dominios a la vez. El dato sale del AI Factory Reality Check, una serie de encuestas que hicieron la encuesta que Virtana presentó en mayo de 2026 en Estados Unidos y amplió el 2 de septiembre de 2026 en Reino Unido, recogidas por VentureBeat y replicadas por AOL y Morningstar en sus versiones del comunicado de Business Wire. Para un founder que está escalando cargas de entrenamiento o inference, el número importa más que la cifra de adopción: significa que cada vez que algo se rompe, el equipo va a pasar horas enteras mirando dashboards mientras las GPUs -el activo más caro de la operación- siguen facturando.

Qué pasa cuando una "fábrica de IA" falla

Una AI factory -el término que usan en Virtana para describir el stack completo: GPUs, almacenamiento, red, pipelines de datos y orquestación en entornos híbridos- produce fallos muy distintos a los de una aplicación tradicional. Un cuello de botella en almacenamiento degrada el pipeline de datos, que a su vez estanca un job de entrenamiento, que termina generando contención de GPU. Según VentureBeat, el monitoreo heredado registra esos tres eventos como tres alertas separadas en tres dominios distintos: técnicamente acertadas, pero incapaces de explicar qué ocurrió de verdad.

El problema se agrava con la escala. El 66% de las empresas de EE. UU. opera su infraestructura de IA sin baselines de rendimiento confiables, y solo el 34% de las estadounidenses y el 26% de las británicas describen el rendimiento de sus cargas de IA como altamente predecible. Entre las organizaciones estadounidenses con más de 50.000 empleados, esa previsibilidad cae al 25%: quienes tienen las fábricas más grandes son justamente quienes menos saben qué van a hacer sus fábricas a continuación.

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

Como resume Paul Appleby, presidente y CEO de Virtana: "Una vez que llegas a la causalidad, puedes remediar. Si no llegas a la causalidad, estás tirando dardos a la pared para entender qué pasó y cómo arreglarlo".

La división entre lo que creen los ejecutivos y lo que ven los ingenieros

La grieta más peligrosa que revela el estudio está dentro de las propias organizaciones. En Reino Unido, el 59% de los ejecutivos asegura que su organización identifica automáticamente la causa raíz de un fallo en todos los dominios, pero solo el 34% de los ingenieros de infraestructura y SRE que reciben esas alertas está de acuerdo. La divergencia es de 25 puntos, más ancha que los 17 puntos registrados en EE. UU. La autoridad final sobre la inversión en IA recae en el liderazgo de TI en el 73% de las organizaciones de Reino Unido, y son esos mismos equipos los que reportan mayor confianza en su capacidad de diagnóstico.

Appleby lo define como un problema de gobernanza: "Las personas que aprueban los presupuestos de IA están trabajando con una evaluación de preparación diagnóstica que sus propios ingenieros no comparten". Para un founder con un board y un CFO mirando números, esto debería encender una alerta: la confianza ejecutiva en la propia infraestructura no coincide con lo que vive el equipo técnico.

Por qué más monitoreo no resuelve el problema

El mercado de observability ya mueve varios miles de millones de dólares, según VentureBeat, y aun así añadir más herramientas por dominio no resuelve el problema de visibilidad cruzada y causalidad. El 75% de las empresas británicas depende de alertas automatizadas como primera respuesta ante un fallo, pero solo el 47% puede identificar la causa raíz automáticamente en todos los dominios. El resto solo ve un dominio único, correlaciona señales a mano entre herramientas o junta a varios equipos durante horas o días.

Los líderes en ambos países -citados por VentureBeat y reproducidos en el comunicado de AOL- ubicaron como prioridad número uno la visibilidad unificada entre IA e infraestructura y como número dos el análisis de causa raíz con IA sin correlación manual. Esas dos opciones lideraron en todos los roles y en todos los tramos de facturación.

Lo que Virtana ofrece como respuesta

Virtana vende una plataforma llamada Agentic Observability, que mantiene un modelo compartido del stack completo de ejecución de IA -on-premises, virtualizado y nube pública- y cuyos agentes autónomos correlacionan en tiempo real utilización de GPU, demanda de tokens, comportamiento del modelo y rendimiento de la infraestructura subyacente, respaldando cada hallazgo de causa raíz con evidencia. Es, en esencia, la materialización comercial de la tesis del artículo: sin un modelo operacional unificado y una topología viva de dependencias, los agentes no pueden actuar.

La apuesta tiene sentido de mercado: Dynatrace presentó su propio State of SRE and Platform Engineering 2026 y anunció la adquisición de Arize por US$915 millones para apuntalar la observabilidad nativa de IA, según reportó Yahoo Finance. Airrived, por su parte, lanzó una capa de Agentic Observability dentro de su Agentic OS con el mismo argumento: "No puedes gobernar lo que no puedes ver", según su CEO Anurag Gurtu. La categoría dejó de ser nicho.

Qué significa esto para tu startup

Si estás entrenando modelos, haciendo inference a escala o vendiendo infraestructura para otros, el hallazgo central cambia la conversación con tus clientes enterprise: ya no basta con prometer GPUs baratas o throughput alto; el cuello de botella real está en la operación. Las decisiones que tomes en los próximos doce meses sobre monitoreo van a determinar si tu fábrica de IA es un activo o una pérdida silenciosa de margen.

Tres acciones concretas para aplicar esta semana:

  • Instrumenta antes de escalar, no después. El patrón "construir primero, instrumentar después si acaso" que describe VentureBeat es el que lleva a que dos tercios de las empresas operen sin baselines. Mide utilización, coste por workload y latencia desde el primer cluster.
  • Invierte en trazabilidad cross-domain, no en otro dashboard más. Una alerta por dominio no es diagnóstico. Pregunta a tu proveedor de infraestructura o a tu equipo de SRE si pueden correlacionar un evento de storage con un job de entrenamiento concreto en menos de una hora.
  • Cierra la brecha entre quien aprueba la inversión y quien la opera. Si tu CTO reporta confianza diagnóstica muy por encima de lo que reporta tu líder de SRE, tienes un riesgo de gobernanza que un board, un auditor o un regulador te van a cobrar caro cuando algo falle.

Conclusión

El cuello de botella de la próxima generación de IA empresarial no es el modelo ni el chip: es la operación que los conecta. Hasta que las organizaciones no tengan un modelo unificado del stack completo y telemetría correlacionada en tiempo real, los agentes de IA van a heredar los mismos puntos ciegos que los operadores humanos y a amplificarlos a velocidad de máquina. Para una startup, eso es una oportunidad doble: quien resuelva observabilidad operativa tiene un problema enterprise enorme y mal atendido; quien la ignore va a tener los mismos fatales que las grandes, pero con menos reservas para absorberlos.

Fuentes

Leíste lo que hace la IA. ¿Y en tu negocio?

En CAR, dueños de empresa arman en 7 días su primer sistema funcionando: que ningún cliente se les escape, o que el informe del lunes salga solo. Con otros emprendedores al lado.

👥 Probar 7 días

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...