¿Qué resuelve Cloudflare con la nueva vista de "overkill" en User Insights?
Cuando el gasto en IA sube sin explicación, el instinto de muchos equipos es mirar el contador de tokens o la cantidad de peticiones. Cloudflare sostiene en una actualización de su blog que esas dos métricas no alcanzan: dos conversaciones con el mismo gasto pueden esconder una tarea de revisión de código y un agente encadenando llamadas, y tratarlas igual lleva a optimizar al lado equivocado.
La nueva función Overkill dentro de AI Gateway User Insights identifica conversaciones donde el modelo elegido parece más capaz de lo que la tarea exige, y a partir de ahí señala qué usuarios, agentes o aplicaciones están detrás del patrón. La compañía lo presenta como una herramienta de diagnóstico, no como un leaderboard automático: el sistema muestra el desajuste, pero la decisión de cambiar el modelo o el flujo la toma el equipo.
User Insights y la nueva vista Overkill están disponibles sin costo adicional para los usuarios de Cloudflare AI Gateway, según el anuncio de la empresa.
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad¿Por qué los tokens y las peticiones no cuentan la historia completa?
Un equipo que enruta su tráfico interno de IA a través de un gateway puede ver que el gasto sube semana a semana sin que la latencia mejore. Cloudflare describe tres patrones típicos que producen ese síntoma: desarrolladores que usan IA para tareas cada vez más complejas, agentes que encadenan demasiadas llamadas de seguimiento, o un grupo pequeño de usuarios o agentes concentrando una parte desproporcionada del consumo.
Las cifras de tokens y el número de peticiones no permiten distinguir cuál de esos patrones domina. Para saberlo, Cloudflare propone cruzar cuatro dimensiones: tipo de tarea, modelo seleccionado, costo total y número de turnos de la conversación. Solo con esa combinación un equipo puede decidir si el problema está en el modelo, en el flujo de trabajo o en la regla de enrutamiento.
El artículo menciona además dos funciones nuevas que se apoyan en estos datos: la vista Potential Savings, que estima qué peticiones podrían resolverse con un modelo más rápido o barato sin perder calidad, y Auto Router, que entra en beta pública y aplica esas señales de forma automática.
La vista Overkill: qué pregunta responde y qué no
La vista Overkill funciona como punto de partida para una investigación, no como veredicto. Cloudflare plantea explícitamente las preguntas que la herramienta ayuda a formular:
- ¿El modelo es apropiado para la tarea?
- ¿La capacidad adicional mejora realmente el resultado?
- ¿Un modelo más rápido o más barato produciría un resultado equivalente?
- ¿El problema se limita a un flujo, usuario o agente concreto?
A partir de ahí, el equipo puede comparar latencia, tokens de entrada y salida, número de turnos y costo total para el mismo tipo de tarea. Una tarea de código o de investigación puede requerir un modelo de razonamiento potente; un resumen corto o una clasificación simple, probablemente no. El objetivo declarado no es mover cada petición al modelo más barato, sino entender si la elección actual es adecuada.
Un caso típico que describe el blog: un equipo descubre que varias peticiones de formateo o resumen simple están terminando en un modelo de razonamiento de alta capacidad. A partir de ahí puede revisar si se usa ese modelo porque es el configurado por defecto, porque los usuarios no saben cuál elegir, o porque un agente fue configurado para usarlo en cada paso.
Análisis de tareas y turnos: el contexto que faltaba
Cloudflare incorpora dos análisis adicionales para entender qué se está haciendo con la IA dentro de una organización:
- Análisis por tarea: agrupa conversaciones en categorías iniciales como código, investigación, redacción, resumen y análisis de datos. Un equipo de ingeniería podría descubrir que la mayor parte de su tráfico es código y depuración, mientras que otro equipo lo usa sobre todo para investigación. Las categorías iniciales son pocas y deliberadamente fáciles de entender, según la compañía.
- Análisis por turnos: muestra cuántos intercambios requiere una tarea hasta completarse. Una conversación larga no es necesariamente mala en tareas complejas, pero si una tarea simple se resuelve en cinco turnos en lugar de uno, hay un prompt, un modelo o un flujo que probablemente merece revisión.
El clasificador que produce estas categorías corre como un Cloudflare Worker dedicado, procesa los logs del AI Gateway de forma asíncrona y devuelve una categoría con un puntaje de confianza. Cloudflare aclara que el resultado no es en tiempo real: las conversaciones nuevas pueden tardar aproximadamente un día en aparecer agregadas en el dashboard, porque la clasificación ocurre después de que el gateway ya atendió la petición.
De la observación al enrutamiento automático
Una vez que un equipo confirma un patrón de overkill con datos de tarea, costo, latencia y turnos, puede convertir esa señal en una decisión de enrutamiento. Cloudflare lo describe con un ejemplo concreto: si la vista de tareas muestra que buena parte del tráfico es resumen y formateo, la vista de modelos indica que esas peticiones van a un modelo grande de razonamiento y la vista de turnos muestra que la mayoría termina en un solo turno, el equipo tiene una carga de trabajo específica para evaluar.
Auto Router, ahora en beta cerrada, toma esas mismas señales de trayectoria de conversación, categoría de tarea, complejidad y ajuste de modelo para enrutar automáticamente cada petición. El enrutador no envía todo al modelo más barato: selecciona uno apropiado para la tarea. El trabajo de código o investigación complejo puede seguir yendo a un modelo capaz, mientras que las tareas simples pueden resolverse con opciones más rápidas o económicas.
Para quienes desarrollan aplicaciones personalizadas, Cloudflare requiere que las peticiones incluyan un user_id y un session_id estables para que User Insights pueda asociar la actividad a la persona y sesión correctas. Herramientas como Claude Code, Codex y OpenCode pueden heredar ese contexto de identidad automáticamente al poner Cloudflare Access delante del AI Gateway, según la compañía. Cloudflare Access está disponible sin costo para equipos de hasta 50 usuarios.
Contexto: el “overkill” como problema de fondo del gasto en IA
El enfoque de Cloudflare se inscribe en una conversación más amplia sobre eficiencia de gasto en IA. La idea de emparejar tarea y modelo en lugar de usar siempre el modelo más capaz ya tiene precedentes comerciales: Runway presentó su Model Router el 23 de julio de 2026 y publicó el 24 de septiembre de 2026 un benchmark en el que reporta hasta un 66% de ahorro en costos de generación de medios manteniendo el 95% de calidad respecto a modelos SOTA, según BlockChain.news.
El reportaje de Business Insider del 5 de agosto de 2026 describe el mismo fenómeno desde el lado empresarial: empresas como Oumi AI, Larridin, Runware, Tensormesh y Conifer están construyendo capas de coaching, medición e infraestructura para reducir el gasto en IA, partiendo de la misma observación: muchos equipos usan modelos frontier para tareas que un modelo más barato resolvería igual. El CEO de Oumi AI, Manos Koukoumidis, lo calificó como una práctica "ampliamente irracional e ineficiente".
En el terreno de optimización de inferencia, TechTarget recoge que el costo por token puede ir de 0,14 a 1 USD por millón de tokens para modelos económicos, de 2 a 15 USD para modelos de gama media y de 20 a 75 USD para modelos de gama alta en tareas complejas o de código, según la guía de la citada publicación. Con un modelo a 5 USD por millón de tokens y 20 millones de tokens diarios, el gasto ronda 100 USD al día o 3.000 USD al mes antes de contar tokens de salida. Elegir mal el modelo para la tarea, advierte el artículo, es uno de los factores que más inflan esa cifra.
Qué significa esto para tu startup
Si tu equipo ya consume modelos pagos, Cloudflare está señalando un patrón que cualquier founder debería poder auditar en una tarde:
- Empieza por mapear tareas, no tokens. Antes de renegociar tarifas, clasifica qué tipo de trabajo realmente está haciendo tu equipo con IA: código, resumen, clasificación, investigación, redacción. Si una parte importante del tráfico cae en tareas simples, es probable que estés pagando capacidad de razonamiento que no usas.
- Mide turnos y costo total, no solo tokens por petición. Una tarea que termina en un turno y otra que necesita cinco pueden parecer similares en un dashboard de tokens, pero la segunda paga varias veces el costo de entrada. TechTarget estima que una tarea agentic puede consumir hasta 30 veces más tokens que un chat básico.
- Evalúa un router o una política de enrutamiento simple. No hace falta un sistema tan elaborado como Auto Router para empezar: una regla que dirija clasificaciones y resúmenes a un modelo económico y reserve los modelos grandes para código e investigación compleja puede recortar el gasto sin tocar el producto.
La apuesta de Cloudflare es que, una vez que un equipo ve dónde está el overkill, el siguiente paso —cambiar el modelo o la ruta— es casi mecánico. El valor real está en el primer paso: saber qué trabajo está haciendo tu IA y para quién.
Fuentes
- Identify AI model overuse with User Insights (fuente original)
- Cloudflare launches Identity-Aware AI Gateway to track who is using AI (contexto sobre el lanzamiento previo de AI Gateway)
- Runway's Model Router Cuts Generative Media Costs by 66% (comparable: router de modelos con ahorros verificados)
- Meet the coaches, measurers, and builders carving out a slice of the AI cost-saving business (panorama de startups que atacan el mismo problema)
- AI inference cost optimization: An enterprise guide (rangos de costo por token y técnicas de optimización)
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad














