La matemática no-lineal que tu status page esconde
El diseñador y desarrollador Jim Nielsen publicó en su blog un argumento que resuena con cualquiera que trabaje en internet: los porcentajes de uptime mienten por diseño. Su punto de partida es una observación del consultor Jason Gorman: pasar del 90% al 99% de fiabilidad cuesta tanto como pasar del 0% al 90%, y del 99% al 99.9% cuesta tanto como todo lo anterior junto.
¿Suena exagerado? Hagamos la cuenta simple. Si un servicio cae un 0.1% del tiempo, eso equivale a diez veces más caída que si cae un 0.01%. En palabras de Nielsen, "99.9% y 99.99% se ven casi iguales, pero el segundo es diez veces mejor". Los profesionales de infraestructura lo internalizan desde el primer día y hablan en shorthand: dos nueves, tres nueves, cuatro nueves. Para el resto del planeta — fundadores, marketers, equipos de soporte, clientes — esos números son ruido.
La comparación que usa Nielsen es útil: leer porcentajes de uptime es como leer la escala sísmica de Richter. Una diferencia de un punto parece pequeña, pero representa un salto de magnitud enorme. Cuando un cliente entra a una status page y ve 99.72%, 99.09% o 98.98%, todos leen como "aprobado" — son la nota que cualquiera quisiera traer de vuelta a la escuela. La realidad operacional es otra muy distinta.
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad2026 fue el año en que los grandes SaaS fallaron en público
El debate de Nielsen no llega en el vacío. CRN documentó los 10 mayores outages cloud de 2026 hasta julio, y la lista lee como unQuién es quién del software empresarial: Microsoft, AWS, Google, Verizon y Cloudflare. El patrón se repite en casi todos los casos.
El caso más paradigmático es el outage de Microsoft 365 del 23 de julio, según el Post Incident Review preliminar citado por TechTimes. Un bug en el sistema que traduce solicitudes de mantenimiento en instrucciones para la red provocó la caída de rutas IP en más dispositivos de los autorizados, dejando aislado al datacenter West US durante casi cinco horas. El resultado: 2.403 reportes en Downdetector en 27 minutos — 83 veces la línea base — y cascadas documentadas en al menos 19 servicios SaaS aguas abajo, de los cuales 16 seguían con incidentes abiertos cuando Microsoft declaró recuperación total. La fiabilidad trimestral acumulada es elocuente: Microsoft 365 entregó solo 99.526% de uptime en Q1 2026, la cifra más baja desde que se empezó a medir en 2013, según el mismo análisis.
El resto del año siguió la misma tónica. CRN documentó la caída de Google Gemini del 10 de junio que dejó sin servicio a unos 950 millones de usuarios activos mensuales durante casi 15 horas; los dos outages de Microsoft Copilot en junio que afectaron a más de 20 millones de asientos pagos; el evento de Cloudflare BYOIP del 20 de febrero, de 6 horas y 7 minutos, donde se retiraron cerca de 1.100 prefijos IP de la red por error; y la salida de Anthropic Claude del 15 de abril, que golpeó a más de 300.000 clientes empresariales. Verizon, en enero, acumuló más de 2,3 millones de reportes en Downdetector y terminó ofreciendo USD 20 de crédito a cada usuario afectado.
El coste, además, se ha disparado. El reporte de Splunk recogido por CRN estima que las empresas del Global 2000 pierden en promedio USD 300 millones al año por caídas no planificadas, con un alza del 50% en los últimos dos años. Cada minuto caído cuesta cerca de USD 15.000, es decir, USD 900.000 por hora. Las acciones de las empresas afectadas caen en promedio 3.4% tras un solo incidente.
Por qué una status page no debería ser una métrica para tu cliente
Nielsen lo expone bien: las status pages se diseñaron para gente de infraestructura, pero hoy las lee todo el mundo. El público de un dashboard público de disponibilidad ya no es solo SREs o DevOps. Es tu equipo de soporte, tu equipo de ventas, tu CFO, y por encima de todo, tu cliente final, que entra cuando algo no funciona y se va cuando confirma que no eres de fiar.
El problema es que el formato tradicional optimiza para la audiencia equivocada. Muestra una barra de colores con 99.9%, 99.72%, 99.09% como si fueran equivalentes. Le pide al visitante que interprete magnitudes logarítmicas sin avisarle. Y mientras lo hace, oculta la única pregunta que de verdad importa: "¿Cuánto tiempo ha estado caído esto últimamente?"
La propuesta de Nielsen es casi trivial: en vez de decir "GitHub Actions: 98.31% de uptime", decir "GitHub Actions: 12 horas afectadas en los últimos 30 días (98.31% de uptime)". La primera cifra exige entender una escala no-lineal; la segunda exige saber qué es una hora. Mismo dato, distinta interfaz, y una que sí puede leer cualquier persona que pague tu factura.
Qué significa esto para tu startup
Si construyes SaaS, tu status page es tu cara pública de fiabilidad. Trátala como un producto, no como un requisito técnico. Si consumes SaaS, esa misma página es la materia prima con la que decides a quién confiar tu infraestructura crítica.
Tres acciones concretas que puedes tomar esta semana:
- Reformula tu status page con tiempo y frecuencia, no con porcentajes. Si tu proveedor publica "99.9%" en su SLA pero no dice cuántos minutos cayó en los últimos 30 días, pídelo. Si tú operas un servicio, publica ambos: el porcentaje sigue siendo útil para auditoría legal, pero el tiempo afectado en horas es el número que tu cliente entiende.
- Mide tus dependencias aguas abajo, no solo tu SLA directo. El SLA de Microsoft 365 cubre Exchange, SharePoint y Teams con un crédito del 25% de la cuota mensual si baja del 99.9%, según el PIR citado por TechTimes. Pero no cubre el blast radius de una caída regional: los 19 servicios downstream del incidente de julio demuestran que tu fiabilidad real es la del eslabón más débil de tu stack, no la del contrato más grande.
- Diseña para el cliente, no para el benchmark. En lugar de presumir de "cinco nueves" (un lenguaje que internamente significa 5.26 minutos de caída al año, pero que tu cliente lee como un eslogan de marketing), muestra tiempos reales de respuesta a incidentes, frecuencia de mantenimiento y tiempo medio de recuperación. Esos tres números, juntos, te separan del resto.
La conclusión de Nielsen es incómoda pero útil: si tu medición de fiabilidad necesita que tu cliente sepa trigonometría para entenderla, no estás midiendo, estás confundiendo. En un mercado donde la confianza digital es la primera línea de retención, esa confusión se paga en churn.
Fuentes
- Can We Stop with the Uptime Percentages? — Jim Nielsen
- The 10 Biggest Cloud Outages Of 2026 (So Far) — CRN
- Microsoft 365 Outage: Azure Maintenance Bug Wiped IP Routes, Taking Down Teams for Hours — TechTimes
- Cloudflare reveals what's behind major internet outages — Help Net Security
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad














