Una vulnerabilidad crítica expone el razonamiento oculto de los modelos de IA más avanzados
Investigadores descubrieron una vulnerabilidad arquitectónica que afecta las APIs de OpenAI, Anthropic y Google, permitiendo extraer los trazos de razonamiento interno (chain-of-thought) de modelos como GPT-5.6, Claude Opus 4.8 y Gemini 3. Según el reporte de Cybersecurity News, el ataque funciona reenviando bloques de razonamiento encriptados desde modelos premium hacia versiones más económicas que actúan como «oráculos de decodificación», revelando pensamientos internos que contienen propiedad intelectual comercial y controles de seguridad.
El problema radica en que las firmas criptográficas utilizan una clave global por proveedor en lugar de estar vinculadas a cuentas específicas, sesiones o niveles de modelo. Esto permite que un bloque encriptado generado por Claude Opus 4.8 pueda ser legalmente pasado a Claude Haiku 4.5, que al tener menos restricciones de seguridad transcribe el razonamiento oculto en texto plano.
Los datos sensibles que se filtraron en 6.708 sesiones públicas
El equipo analizó 6.708 transcripciones públicas de agentes extraídas de GitHub y Hugging Face, decodificando 315.320 bloques de razonamiento encriptados. Lo que encontraron es alarmante: recuperaron 367 artefactos de información personal identificable (PII) y 182 credenciales codificadas, incluyendo 62 claves API, 33 contraseñas y 30 direcciones de correo electrónico personal.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadLa parte más preocupante es que gran parte de esta información sensible residía exclusivamente dentro de los bloques de razonamiento interno y nunca se mostró en las respuestas visibles del asistente. Esto significa que desarrolladores que compartieron sesiones públicas no eran conscientes de que sus logs contenían secretos expuestos.
Cómo funciona técnicamente el ataque de extracción
El proceso descrito en el paper de investigación sigue cuatro pasos claros:
- Capturar un bloque legítimo: Obtener un bloque de razonamiento encriptado/firmado desde una respuesta API
- Reenviar a un modelo más débil: Inyectar ese bloque en una solicitud diferente —potencialmente otra cuenta/sesión— hacia un modelo más económico del mismo proveedor
- Forzar la transcripción: Colocarlo en un turno de asistente/modelo y hacer que el modelo más débil transcriba el razonamiento adjunto
- Muestreo y reconciliación: Muestrear repetidamente, descartar rechazos, y opcionalmente reconciliar múltiples transcripciones ruidosas
Los investigadores confirmaron compatibilidad cruzada idéntica en las familias de modelos de OpenAI GPT-5.6 y Google Gemini 3, validando la precisión matemática comparando las longitudes de tokens decodificados contra los conteos de tokens de pensamiento facturables reportados por las APIs.
¿Qué significa esto para tu startup?
Esta vulnerabilidad tiene implicaciones directas para cualquier founder que esté construyendo productos con IA o utilizando agentes autónomos en sus operaciones:
1. Revisa inmediatamente tus prácticas de logging y compartir sesiones
Si tu equipo comparte logs de sesiones de IA en GitHub, documentación interna o foros públicos, debes asumir que cualquier trazo de razonamiento encriptado podría contener datos sensibles. Según Cybersecurity News, los proveedores ya implementaron mitigaciones del lado del servidor, pero los bloques históricos expuestos en repositorios públicos siguen siendo vulnerables.
Acción concreta: Implementa sanitización de logs que elimine campos de firma crudos antes de hacer públicos los registros de agentes. Trata los bloques de pensamiento encriptados como datos sensibles equivalentes a contraseñas o claves API.
2. Evalúa el riesgo de inyección indirecta de prompts en tus agentes
La vulnerabilidad permite ataques de inyección de prompts indirectos invisibles contra agentes autónomos. Un adversario puede crear instrucciones maliciosas dentro de un bloque de razonamiento encriptado que, cuando es procesado por un agente, las herramientas de monitoreo que inspeccionan solo el historial de conversación visible no detectan el payload oculto.
Acción concreta: Si utilizas agentes autónomos para automatizar workflows críticos, implementa capas adicionales de validación que verifiquen la integridad de los bloques de razonamiento o consideren deshabilitar completamente la funcionalidad de pensamiento encriptado mientras se implementan controles más robustos.
3. Considera alternativas de modelos locales para datos sensibles
Para operaciones que manejen información crítica de clientes, propiedad intelectual o datos regulatorios, los modelos locales pueden ofrecer mayor control sobre la exposición. Modelos como NVIDIA Nemotron 3.5 Lightning (30B MoE con ~3B parámetros activos) o Meta Muse Glimmer 30B (modelo denso multimodal Apache 2.0) ofrecen capacidades de razonamiento sin depender de APIs externas con estas vulnerabilidades.
Acción concreta: Evalúa migrar workflows sensibles a infraestructura local o VPC privada donde puedas controlar completamente el flujo de datos y la exposición de trazos de razonamiento.
El panorama de seguridad en IA se vuelve más complejo
Este descubrimiento llega en un momento de creciente interés en el diagrama de Venn de interpretabilidad que intersecta alineación, seguridad y monitoreo de cadena de pensamiento. Como reporta Latent Space, desde el lanzamiento de o1 los modelos de razonamiento de laboratorios frontier han oscurecido sus trazos con firmas criptográficas por temor a la destilación.
La primera comprometida fue reportada responsablemente por Matthew Green en mayo de 2026, quien desglosó cómo funciona y descubrió cómo reproducir y hacer side channel indirectamente usando medidas de latencia. El paper actual demuestra que es posible DECODIFICAR y portar estos pensamientos encriptados a diferentes modelos/sesiones/usuarios y mejorar dramáticamente modelos abiertos como resultado.
Protecciones recomendadas por expertos en seguridad
Según el análisis de Cybersecurity News, proveedores y desarrolladores empresariales deberían implementar las siguientes protecciones:
- Vinculación criptográfica: Vincular sobres de razonamiento al modelo originador específico, ID de sesión e identidad de usuario en la capa de gateway API
- Aislamiento estricto de modelos: Rechazar bloques de pensamiento enviados a un nivel de modelo diferente al que generó el payload
- Rotación de claves: Rotar claves de firma legadas para invalidar bloques de texto cifrado históricos expuestos en repositorios públicos de código
- Sanitización de logs: Equipos de desarrollo que construyen agentes de IA deben tratar bloques de pensamiento encriptados como datos sensibles
Fuentes
- [AINews] How to steal a Reasoning Trace](https://www.latent.space/p/ainews-how-to-steal-a-reasoning-trace)
- OpenAI, Anthropic, and Google LLM APIs vulnerability Exposes Hidden Reasoning Traces
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













