Fireworks Ember-1 en AI Gateway de Vercel: -40% tokens

Ember-1 aterriza en el AI Gateway de Vercel con un recorte del 40% en tokens generados

Ember-1 ya corre en el AI Gateway de Vercel: el primer modelo razonador de Fireworks AI que llega a esta capa de routing que la propia Vercel factura como centro neurálgico del software agentic. Fireworks lo presenta como research preview con una ventana inicial de dos semanas, construido sobre el modelo abierto Kimi K3 de Moonshot AI y optimizado específicamente para coding agents y flujos agentic donde cada llamada al modelo se repite decenas de veces en una misma sesión.

La promesa concreta que trae la nota de Vercel: aproximadamente un 40% menos de tokens generados frente a Kimi K3 a calidad comparable, según las evaluaciones internas de Fireworks. Para founders que ya están pagando facturas de inferencia que pueden triplicar el costo de su producto, esa cifra cambia el cálculo de viabilidad de un agente.

Qué incluye Ember-1 y por qué importa a tu startup

El modelo llega con una configuración pensada para coding agents, no para chatbots conversacionales:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Ventana de contexto de 1 millón de tokens: cabe una codebase entera, logs extensos o varias horas de transcripción en un mismo hilo.
  • Entrada multimodal de texto e imagen: útil para flujos que combinan capturas, mocks o UI con texto largo.
  • Tool calling nativo: encaja directo con los SDK de los agentes.
  • Prompt caching implícito: los prefijos repetidos no se re-facturan en cada paso.
  • Política Zero Data Retention y No Prompt Training en el endpoint de Fireworks: requisito cada vez más común en procurement enterprise.

Todo se invoca con el identificador fireworks/ember-1 desde el SDK de AI de Vercel, y se integra con Claude Code, Codex y otros coding agents soportados por la CLI vercel ai-gateway setup. El AI Gateway añade tracking de uso, presupuestos por API key, reglas de routing y, sobre todo, una única capa donde consolidar la facturación de múltiples proveedores.

Kimi K3 debajo: por qué Fireworks puede cobrar menos por token

Para entender qué hace competitivo a Ember-1 hay que mirar al modelo base. Kimi K3 fue presentado el 27 de julio de 2026 como un Mixture-of-Experts de 2,8 billones de parámetros, liberado en open weights por Moonshot AI —el laboratorio chino respaldado por Alibaba y Tencent—. En cada token se activan 16 de los 896 expertos disponibles, equivalente a unos 104.000 millones de parámetros en el forward pass, con ventana de contexto también de 1 millón de tokens, según reportó Pulse2.com.

El problema para la mayoría de las empresas no es acceder al modelo, sino servirlo: los pesos ocupan más de 1,4 TB incluso comprimidos con cuantización MXFP4 y los despliegues demandan configuraciones multi-GPU. Baseten, por ejemplo, menciona clusters de 8x Nvidia GB300 sólo para mantener el modelo en memoria, según publicó CryptoBriefing.

Aquí entra el giro geopolítico que ese mismo medio cubrió: tres proveedores de inferencia estadounidenses —Modal, Fireworks y Baseten— están sirviendo Kimi K3 a una fracción del costo del endpoint chino directo gracias a su acceso a hardware (Nvidia GB300, AMD MI350X) que las restricciones de exportación mantienen fuera del alcance de las firmas chinas. Modal reportó 460 tokens por segundo en K3 usando un decodificador especulativo propio llamado DFlash, y los tres están alineados en precios cercanos a US$3 por millón de tokens de input, US$0,30 por millón de tokens cacheados y US$15 por millón de tokens de output, cifras compartidas también por 9to5Mac al cubrir LM Studio Bionic.

La diferencia entre Kimi K3 y Ember-1, según Fireworks, es que el segundo recorta el rastro de razonamiento —ese monólogo interno que el modelo escribe antes de cada respuesta— y deja la respuesta final más corta. En coding agents que llaman al modelo en loop (razonar → tool call → leer resultado → razonar de nuevo), cada iteración paga por tokens de output. Acortar el razonamiento en 40% en cada llamada es lo que mueve la aguja del costo total.

Por qué Vercel, y por qué ahora

El AI Gateway no es una capa más en el stack de Vercel: según los datos que el propio CEO Guillermo Rauch dio a TechCrunch en julio de 2026, ya mueve más de 1 billón de tokens diarios y la mitad de los despliegues en Vercel están hoy disparados por coding agents, frente a menos del 3% a principio de año. SiliconAngle, cubriendo el evento Ship del 17 de junio de 2026, reportó que el volumen mensual de tokens pasó de aproximadamente 2 billones a 20 billones en seis meses.

La tesis del CEO, recogida textualmente por TechCrunch, es que la comunidad está dejando de casarse con un solo laboratorio: «la gente ya entiende cómo funciona todo — model, harness, data platform, sandbox, gateway — cada pieza es plug and play». Empresas como DoorDash, Helly Hansen, OpenAI, Stripe y The Weather Company aparecen como clientes de referencia de la plataforma en la nota oficial distribuida por BusinessWire. Vercel empaquetó todo esto en junio con el Agent Stack (AI SDK, AI Gateway, Sandbox, Workflow SDK, Chat SDK, Vercel Connect) más el framework abierto eve.

Para un founder, Vercel funcionando como agregador neutral significa que añadir Ember-1 —y mañana el siguiente modelo razonador— es cuestión de cambiar el string del modelo en el SDK sin renegociar contratos. El mismo gateway donde hoy enrutas a Anthropic, OpenAI o Gemini suma a Fireworks con la misma factura, budgets y observabilidad.

Qué significa esto para tu startup

Tres acciones concretas que puedes implementar esta semana:

  • Audita cuánto pagas por tokens de razonamiento en tus coding agents. Si hoy usas Claude, GPT-5 o Gemini con razonamiento extendido, abre la consola de uso y mira qué porcentaje de la factura viene de tokens de output —que es donde Fireworks promete el recorte del 40%—. Una sesión típica de coding agent tiene ratios donde el output pesa varias veces el input; recortar el output en 40% baja la factura total de forma relevante.
  • Reserva la ventana de prueba de dos semanas. Es un research preview, no un lanzamiento estable, así que no migres producción todavía. Úsalo para comparar calidad por rastro de tokens en tareas que ya tienes bien medidas: generación de tests, refactors mecánicos, resolución de issues simples con GitHub Issues como input. Mide coste total por tarea completada, no calidad bruta.
  • Ten el setup del AI Gateway preparado aunque no uses Ember-1 hoy. npm i -g vercel@latest y vercel ai-gateway setup dejan tus coding agents con una API key única, budgets por proyecto y trazabilidad de qué modelo atendió cada llamada. Cuando llegue el próximo modelo razonador —y van a seguir llegando cada pocas semanas— cambiar es modificar el string del modelo. Es una defensa barata contra el vendor lock-in.

Conclusión

Ember-1 no es el lanzamiento del año, pero sí es la confirmación de una tendencia que el dato de Vercel ya muestra: el costo por token de razonamiento se está volviendo una variable competitiva seria en coding agents, no un detalle del backend. Mientras los modelos chinos de open-weights sigan obligando a proveedores como Fireworks a diferenciarse por eficiencia (acortar el rastro, no inflar parámetros), founders con agentes en producción van a seguir viendo caer el costo por tarea completada. La pregunta que deja abierta la ventana de dos semanas es si la calidad se sostiene al 60% del rastro: eso lo dirán las pruebas independientes, no el press release.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...