C2C: LLMs se comunican por KV cache y bajan 14x la latencia

Por qué el texto se vuelve un cuello de botella entre modelos

Cuando un sistema multi-LLM pasa el trabajo de un modelo a otro — un router que cambia entre modelos según la tarea o varios agentes colaborando — lo habitual es que el primer modelo comprima lo que sabe en una secuencia de tokens de texto y el segundo la lea para reconstruir la información. Ese trasiego tiene un coste doble: pierde información en la codificación y descodificación, y añade latencia porque el emisor genera tokens uno a uno y el receptor los reprocesa como entrada adicional.

El equipo detrás de Cache-to-Cache (C2C), investigadores de la Universidad de Tsinghua y otras instituciones chinas, cuantifica ese sobrecoste en sus experimentos: en un caso, el modelo "emisor" generó una media de 80 tokens de comunicación que tardaron 1.312 milisegundos en producirse, y esos tokens se sumaron al contexto que el "receptor" tuvo que reprocesar. Cuanto más larga la conversación o más agentes en cadena, mayor la bola de nieve.

Cómo funciona C2C: el KV cache como canal directo

La técnica se apoya en una pieza que los LLMs ya crean durante la inferencia: el KV cache, la memoria temporal donde el modelo guarda las representaciones internas de clave y valor que extrajo del contexto durante la fase de prefill, y que reutiliza al generar cada nuevo token.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Lo que proponen los investigadores de Tsinghua es usar ese caché como canal de comunicación. En C2C, ambos modelos procesan el mismo contexto y construyen su propio KV cache. Uno actúa como Sharer y el otro como Receiver. Un módulo entrenado de cache fusion proyecta el caché del Sharer al espacio de representación del Receiver y lo combina con el suyo; una gate aprendida decide a qué capas del Receiver llega la información adicional.

La clave es que no se generan tokens intermedios: el Receiver incorpora el conocimiento del Sharer directamente desde sus estados internos. El resultado medido por el equipo: alrededor de 90 milisegundos de fusión de caché frente a los más de 1.300 milisegundos del intercambio textual, sin necesidad de generar mensajes en lenguaje natural.

Resultados en los benchmarks: precisión y latencia

Los investigadores probaron C2C en benchmarks de razonamiento y conocimiento como MMLU-Redux, OpenBookQA, ARC-Challenge y C-Eval, fijando a Qwen3-0.6B como Receiver y usando tres modelos Sharer distintos.

Las cifras que reporta el paper, publicado en ICLR 2026:

  • Precisión: C2C elevó la accuracy media del Receiver entre 9,6 y 11,9 puntos porcentuales frente al Receiver trabajando solo, y superó a la comunicación texto a texto por 3,1 a 5,4 puntos.
  • Latencia: la mejora frente a texto fue de 3,46x, 1,51x y 14,41x más rápido según la pareja de modelos. El salto de 14,41x ocurrió con Qwen3-4B Base como Sharer, un modelo que según los autores a veces ignoraba las instrucciones y emitía mensajes más largos de lo esperado, penalizando el baseline.
  • Modelos heterogéneos: la técnica funcionó también entre arquitecturas distintas, con combinaciones Gemma-to-Qwen, Qwen Math-to-Qwen y Qwen Coder-to-Qwen.

Las mediciones de latencia se hicieron con batch size 1 sobre una sola Nvidia A100, una configuración habitual para entornos de producción con baja concurrencia.

El contexto: la comunicación entre modelos como cuello de botella

C2C no aparece en el vacío. Se inscribe en una línea de investigación que cuestiona si el texto debe seguir siendo la interfaz por defecto entre modelos. Nvidia publicó trabajo sobre transferencia de KV cache entre modelos: cuando un sistema cambia de modelo en una sesión larga, la técnica evita reprocesar el contexto acumulando 2,7 a 25 veces más rápido que el re-prefill completo, según reportó VentureBeat. Otro ejemplo es RecursiveMAS, un framework multi-agente que reemplaza mensajes textuales por representaciones latentes continuas y reportó hasta 2,4 veces más velocidad de inferencia y un 75,6% menos tokens consumidos.

El problema de fondo es de costes. Según análisis de TechTarget, una tarea agéntica puede consumir 30 veces más tokens que un chat básico, lo que convierte la optimización del canal entre modelos en una palanca directa sobre la factura de inferencia. En la misma línea, una encuesta de Collibra recogida por HPCWire señala que más del 40% de los proyectos de IA agéntica serán cancelados antes de fin de 2027 según proyecciones de Gartner, precisamente por costes de inferencia mal controlados.

El KV cache como infraestructura tampoco es nuevo: en ICML 2026, Dnotitia presentó STAR-KV, un método de compresión de bajo rango que, según el comunicado de la empresa, logra hasta 20x de compresión del KV cache y acelera el cómputo de atención hasta 6,9x. Es decir, el caché que C2C usa como canal ya es de por sí un objeto de optimización para toda la industria.

Qué significa esto para tu startup

C2C es resultado de investigación, no arquitectura lista para producción: requiere acceso a los internos del modelo (KV caches expuestos), por lo que aplica hoy a equipos que controlan su propio stack de inferencia, no a quien enchufa APIs cerradas. Aún así, el paper marca una dirección clara: la capa de comunicación entre modelos se convierte en un objetivo de optimización de primer orden, al mismo nivel que la elección del modelo o el diseño del prompt.

Acciones concretas que puedes aplicar ya:

  • Audita los traspasos entre agentes en tu pipeline. Mide cuántos tokens se generan solo para "hablar" entre modelos y cuánto tardan. Si ves que un router o un orquestador multi-agente gasta una parte significativa del tiempo en mensajes textuales intermedios, tienes un candidato natural a optimizar.
  • Considera el KV cache como infraestructura. Aunque no puedas usar C2C mañana, técnicas como STAR-KV (compresión), prompt caching o reuso de prefill ya están madurando. Cualquier reducción del tamaño del caché o de su tiempo de construcción impacta directamente en latencia y coste de GPU.
  • Repiensa la arquitectura antes que el modelo. Como señala el análisis de HPCWire sobre inferencia empresarial, el ahorro suele venir más del umbral de escalado (cuándo subir a un modelo más caro) que del modelo elegido. Si vas a construir sistemas multi-LLM, diseña el enrutamiento y la comunicación como decisiones de primera clase, no como pegamento posterior.

El código de C2C está disponible en GitHub bajo licencia Apache 2.0 en el repositorio thu-nics/C2C, con checkpoints del fuser entrenados en Hugging Face (nics-efc/C2C_Fuser). Los autores anunciaron además que planean publicar una implementación de "agent-managed KV-Cache" con un sistema de serving asociado, lo que podría acercar la técnica a despliegues reales en los próximos meses.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...