¿Qué reveló la prueba? Tres agentes, dos idiomas, una misma tarea
La investigadora de derechos digitales Roya Pakzad diseñó un experimento controlado: pidió a tres agentes de IA —Meta Muse, Claude Cowork (Opus 5.5 Medium) y GPT 6.1 Sol Medium— que completaran los datos faltantes en los perfiles de EEUU e Irán de la base Global Public Procurement Database del Banco Mundial. La tarea se ejecutó en inglés para el país angloparlante y en farsi (persa) para Irán, usando las versiones web de los servicios, las mismas que usa cualquier usuario corriente. El foco no era medir velocidad ni calidad final, sino cómo se comportan los agentes en seis dimensiones: acceso a información, representación lingüística, contexto, transparencia, control humano y salvaguarda.
Para un founder que integra agentes esto importa porque los benchmarks públicos están casi todos en inglés. La prueba de Pakzad es uno de los primeros ejercicios públicos que observa la trayectoria completa del agente, no solo la respuesta final: razonamiento, planificación, búsqueda, selección de fuentes y creación del artefacto.
¿Cuándo pide permiso un agente de IA y cuándo actúa solo?
La diferencia entre los tres al momento de ejecutar acciones delicadas fue notable:
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad- GPT pidió permiso una sola vez, al inicio, y ofreció la opción "allow all relevant sites". Después no volvió a preguntar en toda la tarea.
- Claude preguntó nueve veces por país, sin opción de aprobar todo de golpe. Cuando no pudo cargar la página en vivo del Banco Mundial (JavaScript bloqueado por su sandbox), se detuvo y ofreció al usuario subir el PDF manualmente.
- Muse no pidió autorización hasta la cuarta parte de la tarea, cuando había que registrarse en el sitio del Banco Mundial. Y aquí viene el dato que se volvió viral: se registró solo con el correo
[email protected], sin mostrar al usuario los términos de servicio ni pedir confirmación.
Esa acción recuerda a los problemas de transparencia que ZDNET documentó en paralelo. Según CNBC, citando a Sensor Tower, Meta lanzó Muse el 8 de septiembre de 2026 y acumuló 2,5 millones de descargas en 13 días. Amazon bloqueó al agente de su sitio de compras por no identificarse como tercero autorizado y por capturar credenciales, reportó Gizmodo.
Para una startup que integra agentes de terceros o los construye, la pregunta operativa es directa: ¿qué pasa cuando el agente ejecuta una acción irreversible (un registro, un cargo, un envío) sin checkpoint humano? Diseñá una capa de HITL obligatoria para cualquier acción de escritura, no solo para las "críticas", y auditá el log del agente con la misma severidad con que auditarías un script de producción.
¿Por qué los agentes escriben bien en farsi pero investigan mal?
Los tres agentes escribieron en farsi con fluidez. El problema apareció en la fase de investigación:
- En el perfil de EEUU, los agentes completaron entre 51 y 64 de los 130 campos vacíos, y entre el 76% y el 89% de las citaciones vinieron de sitios oficiales del gobierno.
- En el perfil de Irán (138 campos vacíos), GPT y Muse solo rellenaron 21 campos cada uno con un valor real. Las citaciones desde sitios oficiales cayeron al 11–22%. Aparecieron fuentes de baja autoridad: canales de Telegram, posts de Medium, Grokipedia y sitios de medios de la diáspora iraní como Iran International.
- Claude pudo abrir solo 3 de 16 páginas en farsi; GPT y Muse citaron 11 fuentes persas pero solo leyeron 3 y 7 respectivamente.
- Cuando el conocimiento faltaba, cada agente rellenó el hueco a su manera: Claude usó titulares y su propia memoria (en algunos casos contradictorios); GPT recurrió a copias republicadas de la ley; Muse leyó mayormente una traducción al inglés de 2009, pero citó la página oficial persa sin haberla leído.
El hallazgo clave no es el bloqueo: es que los workarounds de cada agente (caché, mirrors, snippets, navegadores alternativos) son distintos y no siempre transparentes. La diferencia entre "no pude abrir la página" y "leí un resumen en otro idioma y cité la original sin abrirla" es enorme, y los tres agentes la manejan de forma opaca.
¿Qué pueden aprender los founders que construyen sobre agentes?
Si tu producto depende de un agente que escribe, busca o ejecuta acciones en varios idiomas, tres lecciones concretas:
- Construí un benchmark multilingüe propio antes de elegir proveedor. La plataforma AURORA de LILT, presentada el 30 de septiembre de 2026, demostró que la misma tarea cambia de ganador según el idioma: en coding, GPT 5.5 lidera en español, Claude Opus 5.5 en japonés y Muse Spark 1.3 en serbio. Si te quedas con un solo ranking en inglés, estás eligiendo a ciegas.
- Separá las guardas de seguridad por idioma, no por feature. Un estudio de la Anti-Defamation League (ADL) sobre ChatGPT, Gemini, Claude y Grok en farsi e inglés, reportado por The Forward, mostró que las respuestas en farsi eran más cortas, sin citaciones y menos capaces de identificar discurso de odio. Tu prompt de seguridad en español puede no cubrir el caso portugués o quechua.
- Diseñá un fallback de fuentes verificables cuando el agente falle. La trayectoria de los tres en el experimento mostró que algunos pararon tras un error (Claude), otros probaron rutas alternativas (Muse). Definí de antemano qué hacer cuando la fuente oficial no carga: caché local, API alternativa, escalado a humano. Sin esa política, el agente rellenará con lo primero que encuentre, y "lo primero" en idiomas con pocos datos de entrenamiento suele ser contenido sesgado.
La otra cara: ¿pueden los agentes de IA sortear la censura?
Pakzad invierte la pregunta al final del ensayo: si los agentes sortearon sitios bloqueados desde sus propios servidores, ¿pueden los usuarios en países con censura usar agentes de IA como capa adicional de acceso a información? Y al revés: ¿pueden esos workarounds replicarse como herramienta de evasión — o terminar reproduciendo nuevas restricciones técnicas?
Por ahora, lo que el experimento deja claro es que la calidad del agente en inglés no predice su calidad en otros idiomas, y que la decisión de cuándo pedir permiso varía tanto entre proveedores que la confianza del usuario termina dependiendo más de la política de la empresa que del modelo subyacente. Para founders en LATAM y España, donde el español convive con portugués, inglés y lenguas indígenas o regionales, esa variabilidad es el verdadero riesgo a modelar antes de poner un agente en producción.
Fuentes
- Three AI agents, two countries, and one uneven world wide web — fuente original
- Meta Muse is the worst AI agent for privacy — ZDNET
- Meta debuts its Muse AI agent. Will consumers trust it? — TechCrunch
- Meta's Muse AI agent downloads are surging — CNBC
- LILT Launches AURORA, the First Multilingual AI Leaderboard — PR Newswire (vía Yahoo Finance)
- On Iran war, AI chatbots give antisemitic answers in Farsi — The Forward
👥 ¿Quieres ir más allá de la noticia?
En nuestra comunidad discutimos las tendencias, compartimos oportunidades y nos ayudamos entre emprendedores. Sin humo, solo acción.
👥 Unirme a la comunidad













