Mercury 2.5 de Inception: 1.100 tokens/s y 80% más barato

Qué trae Mercury 2.5 y por qué importa

Inception Labs, el laboratorio de Redwood City (California) detrás de los primeros modelos de lenguaje por difusión (dLLM) comerciales, presentó el 8 de septiembre de 2026 su modelo Mercury 2.5, al que describe como «el dLLM más capaz del mercado» y, según su conocimiento, «el modelo de lenguaje por difusión más grande entrenado hasta la fecha». Lo posiciona frente a modelos frontier optimizados en costo como GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite y Claude Haiku 4.5.

La propuesta concreta: un salto de inteligencia del 40% respecto a Mercury 2, velocidades por encima de 1.100 tokens por segundo y un precio de lanzamiento con 80% de descuento. Inception afirma que, desde el lanzamiento de Mercury 2, «miles de desarrolladores» han construido sobre su API y «docenas de empresas» la han puesto en producción, con un crecimiento de uso de «más de un orden de magnitud».

Qué cambia respecto a Mercury 2

El salto se concentra en cuatro ejes, según el comunicado de Inception replicado por Yahoo Finance y TMCnet:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Inteligencia: +40% sobre Mercury 2. La compañía habla de «10 puntos de inteligencia» por encima de su predecesor.
  • Velocidad: hasta 1.107 tokens/segundo en GPUs NVIDIA de uso general, sin requerir silicio especializado.
  • Contexto: ventana ampliada de 128K a 260K tokens.
  • Precio de lista: 0,20 USD por millón de tokens de entrada y 0,75 USD por millón de salida. Durante el lanzamiento hay un 80% de descuento: 0,04 USD y 0,15 USD respectivamente.

A esto se suman tres capacidades nuevas: razonamiento ajustable, llamadas a herramientas en paralelo y JSON alineado con esquema. En la práctica, lo que cambia para quien monta agentes es que ahora puedes pedirle al mismo modelo que razone más profundo sin que el presupuesto por request se descontrole.

Por qué un dLLM corre más rápido que un LLM tradicional

La diferencia arquitectónica es lo que sostiene la propuesta de valor. Los LLMs autorregresivos (GPT, Claude, Gemini en sus versiones estándar) generan texto token a token: cada palabra espera a la anterior. Eso ata latencia y costo a la profundidad de razonamiento.

Un dLLM, en cambio, parte de un borrador ruidoso y refina tokens en paralelo. Ars Technica lo explicaba ya en febrero de 2025 al cubrir Mercury Coder: el modelo empieza con todo el texto enmascarado y lo va «desenmascarando» simultáneamente, igual que Stable Diffusion o DALL-E con píxeles. El resultado: varios tokens por paso de inferencia en lugar de uno, lo que se traduce en más inteligencia por dólar y por ciclo de GPU.

Esta semana, además, apareció un paper que apunta en la misma dirección: «Unlocking Lossless Speedups in LLMs via Discrete Diffusion» (arXiv:2609.04010, 3 de septiembre de 2026) presenta Uno, un adaptador que añade pesos de difusión a modelos autorregresivos existentes y reporta hasta 2,5x más throughput en Qwen 8B sin pérdida de calidad, según reportó CryptoBriefing. La señal es clara: la difusión está dejando de ser una rareza de Inception para convertirse en un patrón que otros adoptan como capa de aceleración.

Inception está respaldada por Menlo Ventures, Mayfield, Innovation Endeavors, M12 (el fondo de Microsoft), Snowflake Ventures y Databricks Ventures, con inversores individuales como Andrew Ng, Andrej Karpathy y Eric Schmidt. Su CEO y cofundador es Stefano Ermon, profesor de Stanford.

Casos de uso que ya están en producción

Inception destaca tres workloads donde Mercury está corriendo hoy, no en demo:

Search y RAG. Una sola consulta de búsqueda puede disparar docenas de llamadas: planificar la búsqueda, reescribir queries, rerankear, estructurar hechos, resumir fuentes, validar la respuesta. Mercury mantiene esas llamadas dentro de la ventana de una interacción de usuario. «Varias empresas líderes de infraestructura de búsqueda lo corren en producción», afirma la compañía.

Agentes de voz. OpenCall, que construye agentes telefónicos con IA, reporta una mediana de respuesta cercana a 170 milisegundos tras migrar a Mercury. Su CEO Oliver Silverstein lo resume así: «Nuestro P99 cayó de varios minutos a un segundo, y el P50 de 0,4 a menos de 0,2 segundos, más rápido que cualquier otro proveedor que hemos visto, incluyendo modelos con razonamiento».

Coding agents. Augment Code usa Mercury para compactación de contexto, enrutamiento de modelos y búsqueda de herramientas MCP. Mover la compactación a Mercury redujo la latencia un 82% (de ~150 segundos a 27 segundos) y el costo un 90%, manteniendo calidad, según los datos compartidos por Inception.

Junto con Mercury 2.5, la compañía anunció en preview Mercury Voice (dLLM optimizado para voz con TTFT menor a 170 ms) y Mercury Router (un dLLM que enruta prompts al mejor modelo disponible, abierto o cerrado, según calidad, velocidad y costo).

Qué significa esto para tu startup

Tres puntos prácticos si estás construyendo o eligiendo un modelo para producción:

  • Voz e interactivos en tiempo real son viables con un modelo de razonamiento. Si tu agente de voz o asistente interactivo se atraganta con la latencia, 170 ms de mediana es un umbral que cambia el feel del producto. OpenCall no es un caso aislado: ya hay empresas de búsqueda y coding usando el modelo.
  • El coste por token ya no es la única palanca. Cuando el modelo genera varios tokens por paso, tu factura de inferencia se mueve con la arquitectura, no solo con el precio unitario. Si te interesa comparar coste total por request, no compares solo precios de lista: mide tokens/segundo en tu workload real.
  • La capa de enrutamiento empieza a ser un producto. Mercury Router es un dLLM que decide qué modelo responde. Es un patrón que probablemente veremos replicado: el routing inteligente se vuelve un servicio de primera clase, igual que pasó con el load balancing en infra web.

Acciones concretas:

  • Si tienes un agente de voz o un workflow interactivo con latencia visible, prueba Mercury 2.5 con los 100 millones de tokens gratis que ofrece Inception en su API. Mide P50 y P99 con tu workload real antes de comprometerte.
  • Si tu cuello de botella es compactación de contexto o reranking en pipelines RAG, replica el caso de Augment Code: mueve esas tareas a un dLLM y compara latencia y costo por request. Es donde más rápido se nota el ahorro.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...