¿Por qué el model routing se volvió crítico para las empresas en 2026?
Glean alcanzó $300 millones en ingresos anuales recurrentes (ARR) mientras su CEO Arvind Jain advierte que los costos por usuario de modelos avanzados como Opus y GPT subieron entre 10 y 20 veces respecto al año anterior. La combinación de precios más altos por token y tareas más largas está llevando a las organizaciones a adoptar masivamente el model routing — la capacidad de seleccionar automáticamente qué modelo usar para cada tarea.
Este fenómeno no es anecdótico. La semana pasada, Stripe cerró la adquisición de OpenRouter por más de $7.000 millones, consolidando el routing como una capa de infraestructura crítica. OpenRouter opera con 8 millones de usuarios globales y más de 400 modelos disponibles, según reportó Bloomberg el 16 de agosto de 2026.
Para un founder hispanohablante que evalúa implementar IA en su organización, esto significa algo concreto: la estrategia de un solo proveedor ya no es viable. Las empresas están pasando de depender de uno o dos modelos a arquitecturas multi-proveedor donde el routing inteligente es el factor diferencial entre rentabilidad y gasto descontrolado.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadCómo funciona el model routing en la práctica
Glean ofrece tres niveles de selección de modelos:
- Selección explícita del empleado: el usuario decide manualmente qué modelo usar.
- Restricciones administrativas: los admins limitan qué modelos están disponibles o imponen límites de uso.
- Modo automático: el sistema selecciona dinámicamente el modelo óptimo para cada tarea.
Según Jain, el modo automático es el más elegido por los clientes por razones económicas. Un dato clave: el cofundador de Glean Tony Gentilcore afirmó que Glean es «4x más costo-efectivo» que Claude Code, promediando $0,45 por tarea versus $1,84 para Claude Cowork. Esa diferencia se atribuye directamente a las capacidades de routing.
El mecanismo detrás del ahorro tiene dos componentes. Primero, Glean separa la recopilación de datos del procesamiento con LLMs. Su modelo interno llamado Waldo, lanzado en abril de 2026 como «el primer modelo de búsqueda agéntica de Glean», actúa como filtro previo: decide cómo desglosar la pregunta, qué herramientas usar y cuándo tiene evidencia suficiente para pasar al modelo frontier.
Esto reduce la latencia en un 50% y los tokens consumidos en un 25%, según Glean. El principio es simple pero poderoso: un modelo más barato con mejor contexto puede superar a un modelo frontier cargado con datos irrelevantes.
La explosión de los modelos open-weights en empresas
Uno de los cambios más significativos reportados por Jain es la adopción acelerada de modelos open-weights. Según sus palabras textuales: «El año pasado, el uso de LLMs open source era minúsculo y nadie consideraba seriamente el open source. Pero en los últimos tres meses, debido a que la IA se volvió tan cara, las empresas empezaron a encontrar insostenible mantener estas inversiones en IA».
La conclusión actual: «Hoy puedo decir que en la mayoría de las empresas, consideran que los modelos open source son parte clave de su estrategia de IA». Más allá de eso, Jain señaló que «nadie quiere depender de un solo proveedor de modelos, ni de dos, y nadie cree que pueda sobrevivir sin open source».
Este cambio refleja una tendencia global. En OpenRouter, una investigación de CNBC publicada el 7 de julio de 2026 reveló que los modelos de origen chino capturaron el 46% del uso de tokens empresariales en Estados Unidos. La diversificación de proveedores ya no es opcional; es una necesidad operativa y geopolítica.
¿Cómo evalúan la calidad del routing?
Glean implementa un sistema de evaluación continua que combina tráfico real con judges basados en IA. El proceso funciona así:
- Dejan que el router seleccione el modelo para el usuario.
- En paralelo, ejecutan la misma tarea con otros modelos (más baratos y más caros).
- Usan «jueces basados en IA» para determinar qué tan acertado fue el router.
- Actualizan continuamente el sistema con nuevo tráfico real.
Esta evaluación se realiza solo sobre «una pequeña fracción» del uso real, pero a la escala de Glean — con adopción del 80% en Zillow (7.000 empleados) y despliegue completo en Booking.com — ese porcentaje equivale a miles de casos diarios que alimentan el ciclo de mejora.
Qué significa esto para tu startup
Si estás evaluando arquitectura de IA para tu empresa, hay tres lecciones concretas de este caso:
1. No dependas de un solo proveedor. La concentración en un modelo te expone a aumentos de precio arbitrarios y a riesgos de disponibilidad. El artículo confirma que los modelos más avanzados cuestan «el doble o el cuádruple» por token que sus predecesores, y los usuarios los aplican a tareas más largas. El costo por usuario puede multiplicarse x10 o x20 en un año.
2. Invierte en la capa de routing antes que en el modelo más caro. Si tu stack actual usa el mismo modelo para todo — desde sumar números hasta generar análisis complejos — estás desperdiciando presupuesto. Implementa lógica de selección basada en tipo de tarea, incluso si empieza siendo reglas simples (si la consulta requiere cálculo aritmético básico, no envíes tokens a un modelo frontier).
3. Considera modelos open-weights para tareas de menor complejidad. Jain confirmó que los open weights son «un orden de magnitud más baratos» para ciertas tareas. Si tu equipo aún siente estigma hacia estos modelos, revisa benchmarks recientes de Qwen3.8-Max y Kimi K3, que han cerrado brechas significativas en calidad mientras mantienen costos drásticamente inferiores.
Acciones inmediatas:
- Audita tu consumo actual de tokens por tipo de tarea. Identifica cuántos van a modelos premium para trabajo que podría resolverse con modelos más económicos.
- Evalúa gateways de routing como OpenRouter (ahora parte de Stripe) o soluciones internas que permitan switching dinámico entre proveedores.
- Establece métricas de calidad por modelo: no basta con medir costo; necesitas saber qué nivel de precisión acepta cada caso de uso antes de escalar al siguiente modelo.
Fuentes
- Frontier Model Cost and Open-Weights Popularity is Driving Demand for Model Routing
- Stripe Acquires OpenRouter for $7B+, Turning Model Routing Into a Payments Infrastructure Problem
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













