Las empresas están pagando hasta tres veces más de lo necesario por consultas simples de inteligencia artificial. Ese es el diagnóstico que motiva el anuncio de hoy: Snowflake lanzó routing dinámico de modelos en su Cortex AI Gateway, una capa de gobernanza que selecciona automáticamente el modelo correcto para cada tarea —y promete recortar costos de tokens hasta en un 300% según pruebas internas de la empresa.
La noticia llega cuando el gasto en inferencia de IA se convirtió en el talón de Aquiles de cualquier startup que escala agentes autónomos. Enviar todas las consultas al modelo más caro de la casa funciona cuando tienes decenas de agentes. Cuando llegas a cientos o miles, la factura se dispara sin control.
¿Cómo funciona el model routing de Snowflake?
El sistema opera con dos mecanismos principales, según explicó Baris Gultekin, VP de IA de Snowflake:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadUn modelo pequeño intenta primero. Bajo lo que Snowflake llama "advisor pattern", un modelo más ligero procesa la consulta inicialmente. Si no puede resolverla, invoca a un modelo más grande como herramienta y continúa desde ahí.
Un clasificador ordena por historial. Un clasificador entrenado con consultas pasadas enruta preguntas sencillas directamente a modelos más simples, evitando el paso del modelo pequeño.
Los clientes pueden restringir el routing a uno o varios modelos específicos, y el sistema solo rutea dentro de ese límite. No hay cargo adicional por la decisión de routing —Snowflake cobra puramente por tokens consumidos, así que enviar a un modelo más barato produce una factura más baja directamente.
Gobernanza: donde Snowflake marca la diferencia
El diferenciador real no es el routing en sí, sino cómo se integra con la infraestructura existente de Snowflake. El acceso a modelos sigue los mismos controles de acceso que usa para datos:
- Controles basados en roles a nivel de datos
- Roles de cliente mapeados a buckets de modelos aprobados
- Agentes con privilegios más estrechos que el usuario que los invoca
Snowflake también soporta modelos open-source como DeepSeek-V4-Flash y GLM-5.3 ejecutándose desde regiones propias del cliente para cumplir requisitos de residencia de datos. Toda la inferencia permanece dentro del perímetro de seguridad de Snowflake.
La reciente adquisición de Natoma agrega más de 100 conectores MCP con acceso gobernado y scoped. Un agente podría tener solo lectura a una herramienta como email, en lugar de permisos amplios.
Herramientas como Horizon Context y Cortex Sense permiten empaquetar contexto antes de enviar la consulta al modelo. Sin buen contexto, el modelo debe hacer trabajo exploratorio —escribir SQL, buscar datos, reintentar— lo cual requiere un modelo más capaz y costoso. Con el contexto preempaquetado, un modelo más simple puede resolver la misma tarea.
El ecosistema de routing se consolida rápidamente
Snowflake no está solo en esta carrera. El mercado de model routing está experimentando una consolidación acelerada:
Nvidia anunció el 11 de agosto su router Switchyard junto con el modelo Nemotron 3.5 Lightning. En pruebas propias, la combinación redujo costos de tareas a un tercio comparado con ejecutar Opus 4.8 solo. Partners como LangChain reportaron una reducción del 74% en costos al enrutar solo el 7% de llamadas a un modelo frontier. Ramp logró matching de performance frontier con costos reducidos un 58%.
OpenRouter, pionero del segmento con 8 millones de usuarios globales y acceso a más de 400 modelos, fue adquirido por Stripe por más de USD 7.000 millones en agosto de 2026, según reportó Bloomberg. Esa cifra representa un premium de 5.4x sobre la valoración de USD 1.300 millones que alcanzó en su Serie B en mayo de 2026. Para ilustrar la magnitud del problema: una investigación de CNBC reveló que modelos de origen chino capturaron el 46% del uso de tokens empresariales en Estados Unidos sobre OpenRouter.
Databricks ofrece Smart Routing para su Unity AI Gateway, con un enfoque diferente centrado en data engineering y ML lineage.
Sanjeev Mohan, fundador de SanjMo, identifica tres campos distintos en este mercado: Databricks (gobernanza desde ingeniería de datos), Snowflake (gobernanza desde analytics y access control), y gateways neutrales como OpenRouter, LiteLLM y Portkey (competencia por amplitud de modelos).
Qué significa esto para tu startup
Si estás construyendo agentes de IA en producción, el model routing dejó de ser un lujo técnico para convertirse en una necesidad financiera. Aquí va lo que importa:
El costo de inference escala linealmente con el número de agentes. Lo que funcionaba con una docena de agentes colapsa a escala. Si tu startup tiene más de 50 agentes haciendo llamadas automáticas sin verificación de costo, estás dejando dinero sobre la mesa.
La decisión de router es una decisión de gobernanza, no técnica. Como señala Mohan, la pregunta correcta no es "cuál router es más rápido" sino "qué modelo de gobernanza ya encaja con cómo están organizados mis datos y equipos". Si tu data ya vive en Snowflake, el routing nativo de esa plataforma te da visibilidad de costos por centro de costo y respeta tus controles existentes. Si tu stack es multi-plataforma, un gateway neutral como OpenRouter (ahora bajo Stripe) o LiteLLM puede evitar lock-in.
Empaqueta contexto antes de llamar al modelo. La recomendación más accionable viene directo de la arquitectura de Snowflake: si puedes anticipar qué contexto necesita el agente y empaquetarlo antes de la llamada, un modelo más barato puede resolver tareas que antes requerían un modelo frontier. Esto aplica a cualquier stack, no solo al de Snowflake.
Acciones concretas para implementar esta semana
Audita tus llamadas de inferencia. Identifica cuántas consultas son simples (lookup, resumen, clasificación) versus complejas (razonamiento, generación creativa). Las simples deberían representar entre el 60% y 80% de tu volumen total.
Implementa routing básico aunque sea manual. Si aún no usas un gateway de routing, empieza con LiteLLM o una integración directa con múltiples proveedores. Configura reglas simples: consultas cortas → modelo económico; consultas largas o complejas → modelo avanzado.
Atribuye costos de inferencia por equipo o producto. Independientemente del router que elijas, necesitas saber cuánto cuesta cada agente, cada equipo y cada línea de producto en inferencia. Sin esa visibilidad, no puedes tomar decisiones informadas sobre optimización.
Evalúa modelos open-source para workloads específicos. Modelos como Nemotron 3.5 Lightning o Qwen3.6-35B pueden manejar workloads especializados a fracción del costo de modelos propietarios, especialmente cuando están emparejados con un router inteligente.
Fuentes
- Enterprises are overpaying for simple AI queries — Snowflake's gateway now auto-routes to cut costs up to 3x
- Nvidia's Switchyard router reshuffles AI models mid-task, cutting task costs to a third in its own tests
- Stripe Acquires OpenRouter for $7B+, Turning Model Routing Into a Payments Infrastructure Problem
- Snowflake vs. Verizon: Which Technology Stock Is a Better Buy in 2026?
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













