Alucinación de IA casi desata guerra entre EE.UU. y China

¿Qué pasó exactamente con la alucinación que casi desata una guerra?

En la primavera de 2026, aviones militares de EE.UU. ya estaban en el aire ejecutando una operación armada contra un buque chino en Medio Oriente cuando alguien en la cadena de mando descubrió, a tiempo, que la inteligencia que justificaba el ataque había sido una alucinación de un chatbot de IA. La operación se abortó en el último minuto, según reportó CNN el viernes y reprodujo TechCrunch, citando a cuatro fuentes familiarizadas con el episodio. Una de ellas llegó a decir que el incidente casi inicia una guerra.

El informe señalaba que el buque transportaba componentes para un programa de armas nucleares. Su origen fue un analista de Special Operations Command que usó un chatbot para combinar datos de inteligencia de fuentes abiertas con señales clasificadas. La herramienta malinterpretó el manifiesto de carga del barco. El analista usó el mismo chatbot una segunda vez para dar formato a las conclusiones erróneas en un resumen de apariencia oficial, que circuló sin cuestionamientos por los canales de mando, como destacó Ars Technica.

CNN no pudo determinar qué herramienta se usó exactamente ni qué transportaba el barco en realidad. Lo que sí está confirmado es que el incidente ocurrió mientras EE.UU. estaba en guerra con Irán, y que la velocidad con la que se disparó la cadena de decisión fue la misma que casi convierte un error técnico en una crisis geopolítica.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

¿Por qué el Pentágono está acelerando la adopción de IA sin controles suficientes?

El episodio no es un accidente en un sistema cautelado: es el resultado esperado de una estrategia deliberada. En enero, el Secretario de Defensa Pete Hegseth firmó una directiva que insta al Departamento de Defensa a ser AI-first y a experimentar con modelos de las principales empresas de IA de EE.UU., según reportó Engadget. La estrategia se apoya en una orden ejecutiva de abril de 2025, un plan de acción de IA de julio de 2025 y la Ley de Autorización de Defensa Nacional del año fiscal 2026.

El corazón del programa es un Barrier Removal Board con autoridad para eliminar requisitos no estatutarios en pruebas, contrataciones y personal, y una regla: adoptar modelos frontera en los 30 días siguientes a su lanzamiento, según análisis de War on the Rocks. La promesa es acortar la kill chain, el tiempo entre detectar un objetivo y actuar sobre él, para mantener la ventaja frente a China.

Para dimensionar la velocidad: durante la Operación Epic Fury, el Mando Central de EE.UU. usó Claude a través de la plataforma Maven Smart System de Palantir para generar y priorizar aproximadamente 1.000 objetivos en las primeras 24 horas de la campaña. En 38 días se alcanzaron 13.000 strikes y Maven asegura haber acelerado el ritmo hasta 5.000 objetivos en un solo día. Project Maven se ha trazado como meta 1.000 decisiones de targeting de alta calidad por hora, una cifra que para cualquier founder suena a producto en producción continua, no a piloto.

En paralelo, el Pentágono amplió su cartera de proveedores de IA clasificada de uno a ocho vendors el 1 de mayo, tras su disputa con Anthropic, y selló acuerdos con OpenAI, xAI (Grok), NVIDIA, Microsoft y Amazon para uso militar.

¿Qué tan grave es el problema de las alucinaciones en los modelos actuales?

El riesgo operativo de las alucinaciones no es hipotético. Según el benchmark HalluLens citado por War on the Rocks, los modelos frontera alucinan entre 27% y 85% de las veces en consultas fácticas cortas y pueden inventar respuestas sobre entidades inexistentes hasta un 94% del tiempo. En pruebas internas del 18th Airborne Corps de 2024, Maven identificaba objetos correctamente el 60% de las veces frente al 84% de analistas humanos. No hay datos públicos que indiquen si esa brecha se ha cerrado desde entonces.

Esa fragilidad se cruza con un fenómeno conocido como sesgo de automatización: cuando un sistema genera recomendaciones articuladas con coordenadas precisas y tono seguro, el operador humano tiende a confiar. El precedente es crudo. En 2003, baterías Patriot en modo automático derribaron un Tornado británico y un F/A-18 de la Armada sobre Irak, matando a tres tripulantes; una Junta de Ciencias de Defensa concluyó que los operadores no tenían cómo cuestionar lo que sus sensores les decían. Los LLM actuales son menos maduros y menos acotados que aquel Patriot.

La propia estructura del Pentágono no está preparada para frenarlo. El Responsible AI Office perdió personal este año por programas de retiro y mandatos de retorno a oficina. El Director of Operational Test and Evaluation vio su plantilla recortada a la mitad en mayo de 2025 y eliminó cerca de 100 programas de su lista de supervisión. Una encuesta de mediados de 2026 encontró que ningún responsable de decisión del Departamento reportó plazos de autorización inferiores a seis meses. La capacidad de evaluar IA generativa de forma independiente, al ritmo que la misión exige, simplemente no existe.

¿Por qué Anthropic y el Pentágono se enfrentan por las guardrails de IA?

La guerra de fondo entre el Pentágono y Anthropic es la otra cara de esta historia. Anthropic se negó a retirar las guardrails internas que impedían usar Claude en armas autónomas letales y vigilancia masiva. El Pentágono respondió designando a la compañía como supply chain risk, una categoría reservada previamente para entidades vinculadas a adversarios extranjeros, y exigiendo a contratistas certificar que no usaban sus modelos. OpenAI firmó un acuerdo con el Pentágono para usar sus herramientas en sistemas clasificados horas después de la designación, según reportó The Daily Beast.

A fines de agosto, la jueza federal Rita Lin declaró esa designación ilegal por violar la Primera y la Quinta Enmienda y ordenó retirarla. La sentencia destaca una contradicción incómoda: el Pentágono no logró demostrar que Anthropic tuviera acceso de puerta trasera a su tecnología, y la propia dependencia había seguido usando Claude mientras lo denunciaba. La orden no obliga al Pentágono a comprar Anthropic, pero sí le prohíbe penalizar a proveedores por mantener cláusulas de uso responsable.

Para el mercado de IA empresarial, la lectura es directa: los límites de seguridad que un vendor mantiene por diseño pueden ser ahora una ventaja competitiva, no un obstáculo de ventas.

¿Qué significa esto para tu startup?

Sea que vendas un copiloto, un agente, una herramienta de análisis o un SaaS vertical con LLM debajo, este caso redefine tres reglas del juego:

  • El human-in-the-loop deja de ser una buena práctica y se convierte en un requisito contractual. Los compradores enterprise y gobierno van a exigir evidencia de controles, logs de auditoría y tasas de error medidas en su propio dominio, no en benchmarks genéricos. Quien no pueda mostrarlo perderá licitaciones.
  • Las guardrails son un argumento de venta, no una rémora. La pelea Anthropic–Pentágono demuestra que mantener cláusulas sobre uso aceptable protege al cliente final y blinda al vendor frente a riesgos legales y reputacionales. Documentarlas y hacerlas visibles en tu pitch es ahora una ventaja.
  • La velocidad sin assurance destruye confianza más rápido de lo que la construye. Como resume Jake Steckler, investigador de GovAI y veterano del Ejército de EE.UU., priorizar la adopción por encima de todo llevará a incidentes que harán perder la confianza de los usuarios y, al final, frenarán la adopción. Tu roadmap tiene que equilibrar tiempo de salida con tiempo de evaluación.

Dos acciones concretas que puedes implementar esta semana:

  • Audita tu pipeline crítico. Documenta cada punto donde una salida de LLM se usa para tomar una decisión con consecuencia real (financiera, legal, operativa, clínica) y mapea qué control humano existe. Si el control es decorativo, es un pasivo esperando un incidente.
  • Diseña una política de acceptable use pública. Aunque seas una startup de cinco personas, redacta y publica qué usos prohíbe tu producto. Te servirá para RFPs, para clientes enterprise y, si escalas, para defenderte de intentos de reescribir tus términos a última hora.

Conclusión

La operación abortada del Pentágono no es una curiosidad geopolítica: es el caso de manual de lo que ocurre cuando se combinan modelos con tasas de alucinación de hasta 85%, presión por desplegar en 30 días y una cadena de mando que confía en outputs de apariencia oficial sin segunda lectura. La pregunta ya no es si la IA puede equivocarse (sabemos que sí, y con qué frecuencia), sino quién asume el costo cuando lo hace: el analista, la empresa, el cliente o el soldado. Para un founder, la lección es incómoda y rentable al mismo tiempo: la confianza en IA no se gana con demos brillantes, se gana con assurance.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...