1M tokens/s: por qué más velocidad no es más trabajo

1M tokens por segundo: por qué más velocidad no es más trabajo

Un millón de tokens por segundo: el número que la publicación "What if AI worked at 1,000,000 tokens per second?" de echohive.ai propone como ejercicio mental. El resultado contraintuitivo es la parte más útil: aunque el dial imaginario multiplicara la velocidad de generación por 10.000, el trabajo terminado apenas se aceleraría. La razón se llama ley de Amdahl, y aplica directamente a cómo los founders encaran la automatización con IA en 2026.

Qué significa realmente "1M tokens por segundo"

El artículo distingue cuatro cosas que se mezclan cuando se habla de velocidad de un LLM. Confundirlas lleva a presupuestos y plazos mal calibrados.

  • Capacidad de contexto es cuánto cabe en una petición. El overview de Claude Opus 5.5 lista una ventana de 1 millón de tokens, con un máximo de 128K de output por petición. Es un tamaño, no una velocidad.
  • Procesamiento de entrada es qué tan rápido el modelo lee el prompt. Los prompt tokens se procesan en paralelo, pero un input enorme sigue tomando tiempo, y la tasa de lectura no es la misma que la de escritura.
  • Throughput agregado es lo que sirve un sistema completo. 10.000 streams × 100 tokens/s = 1 millón de tokens/s en total. Es aritmética de juguete: no dice cuándo termina una conversación individual.
  • Output de un solo agente es la perilla del ejercicio mental de echohive: un agente escribiendo un millón de tokens por segundo. En generación estándar, cada token depende del anterior. Esa cadena secuencial no se elimina con ninguna técnica actual.

Qué hace la industria para acercarse (sin llegar)

La optimización de inferencia lleva años atacando el cuello secuencial. Speculative decoding, demostrada por Google en 2022, permite aceptar varios tokens por paso: un modelo pequeño propone candidatos, el grande los verifica en paralelo. La técnica entrega entre 2× y 3× de aceleración sin cambiar la calidad.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

En julio de 2026, NVIDIA publicó como preprint en arXiv a Nemotron-Labs-Diffusion, un modelo entrenado con un objetivo conjunto autorregresivo y difusivo. En modo self-speculation, el mismo checkpoint hace de drafter y verificador. El preprint reportó 5,99× tokens por forward pass en la variante 8B instruct y 6,82 tokens aceptados por paso en SPEED-Bench, frente a 2,75 del método Eagle3 publicado en NeurIPS 2025.

En agosto de 2026, OpenAI presentó su modo "Ultrafast" para GPT-5.6 Sol, con 750 tokens por segundo y 14× la velocidad estándar. Funciona gracias a la integración con Cerebras. Por su parte, Anthropic lanzó Claude Opus 5.5 el 22 de septiembre de 2026 con 30% más velocidad que Opus 5, ventana de 1M tokens, output máximo de 128K, y precios de US$4 por millón de tokens de input y US$20 por millón de output.

Son números reales. Pero ninguno rompe la cadena secuencial: cada token sigue dependiendo del anterior. Multiplicar el throughput o la velocidad de un solo agente por 10.000 sigue siendo, hoy, un ejercicio de aritmética.

La trampa de la ley de Amdahl

El corazón del artículo de echohive es una tabla donde se compara el tiempo total de una tarea a 100 tokens/s y a 1.000.000 tokens/s, sumándole un check fijo que la velocidad no acelera. Con 40 borradores × 20.000 tokens (800.000 tokens):

  • Sin check: 2 h 13 min 20 s vs 0,8 s → 10.000× más rápido.
  • Con check de 60 s: 2 h 14 min 20 s vs 60,8 s → 132,57× más rápido.
  • Con check de 15 min: 2 h 28 min 20 s vs 15 min 1 s → 9,88× más rápido.
  • Con check de 24 h: 26 h 13 min 20 s vs 24 h 1 s → 1,09× más rápido.

A un día completo de check, la aceleración marginal se evapora. Es ley de Amdahl: lo que no se acelera ocupa casi todo el tiempo restante. La guía de latencia de OpenAI lo dice en otras palabras: prompts muy grandes, llamadas a herramientas y viajes de red añaden sus propios retrasos que la velocidad de generación no toca.

Qué sigue siendo escaso aunque la IA escriba al instante

El artículo enumera seis cuellos que la velocidad pura no resuelve. Para un founder son más importantes que la perilla:

  • Gusto: cuál opción es la tuya.
  • Specs y tests: qué significa "funciona".
  • Práctica: la velocidad no puede aprenderla por ti.
  • Evidencia física: el mundo responde a su propio ritmo.
  • Fidelidad: una simulación es solo tan buena como su modelo.
  • Costo y energía: cada token corre en hardware que alguien paga.

Qué significa esto para tu startup

El ejercicio mental de echohive entrega algo más concreto que una métrica: una lista de trabajo. Cuatro hábitos operativos que separan a un equipo que automatiza de uno que se engaña con demos rápidas.

  • Escribe qué significa "terminado" en una frase testeable. "Las escaleras se devuelven en siete días", no "maneja préstamos". El primer enunciado tiene un test; el segundo no.
  • Define los criterios antes de leer las opciones. Dos o tres, no diez. Si no, gana el más elocuente por defecto, no el mejor.
  • Identifica el paso lento. Ponle etiqueta al check que la velocidad no acelera y trata de recortarlo o automatizarlo. En la mayoría de equipos, ese paso es la aprobación final, las pruebas de integración o la revisión humana.
  • Pide desacuerdo, no volumen. Solicita opciones construidas sobre supuestos distintos y pregunta qué las haría estar todas mal. Diez mil respuestas de un solo modelo son una forma elegante de compartir el mismo punto ciego.

La velocidad de inferencia va a seguir subiendo. Los 750 tokens/s de GPT-5.6 Sol de agosto de 2026 y los self-speculation de NVIDIA de julio son señales claras de que el sector no se ha detenido. Lo que no va a cambiar solo con velocidad es tu criterio, tus tests y tu capacidad de decidir. Eso es lo que define el tiempo total de un proyecto de IA en producción hoy. La parte de generación es la más barata y la más rápida de arreglar.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...