El hallazgo: el watermark que cambia lo que dice y lo que hace el modelo
El 17 de septiembre de 2026, Andrea Siposova, investigadora de seguridad de IA en Lasso Security, publicó The Provenance Tax: Understanding the Impact of LLM Watermarking on AI Agent Behavior, un estudio que documenta un efecto inesperado del watermarking de texto: alterar tanto las palabras que produce el modelo como las herramientas que invoca un agente basado en él. La investigadora lo bautiza como «sampling drift» (deriva de muestreo).
El trabajo llega en un momento sensible: Anthropic anunció el 14 de agosto de 2026 que sus futuros modelos Claude incluirán SynthID-Text, el watermark de Google DeepMind, para cumplir con el EU AI Act, cuya entrada en vigor el 2 de agosto de 2026 obliga a marcar los textos generados por IA de forma identificable por sistemas automáticos.
¿Qué es SynthID-Text y por qué importa a quien despliega LLMs?
SynthID-Text opera en la capa de selección del siguiente token: cuando el modelo debe elegir entre varias palabras razonables para continuar el texto, una clave secreta modifica sutilmente la fuente de aleatoriedad para sesgar la elección. Si el modelo iba a decir «cloudy», la clave podría empujarlo a decir «overcast». La sustitución es invisible para un lector humano, pero estadísticamente detectable para quien tenga la clave.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadGoogle DeepMind publicó el método como open source en octubre de 2024, tras validar en un paper de Nature (Dathathri et al.) que sobre unos 20 millones de respuestas de Gemini no se observó degradación de calidad medible. Por eso Anthropic, y antes Google, Meta, Microsoft y OpenAI, lo adoptaron como vía de cumplimiento del EU AI Act.
El problema, según Siposova, es que la garantía de «no distorsión» es un promedio sobre la aleatoriedad del watermark. Bajo una clave fija y en una generación concreta, los tokens que eligen pueden cambiar, y eso se nota en lo que el modelo decide hacer cuando actúa como agente.
Cómo midió Lasso el «sampling drift»
El equipo usó la implementación de SynthID-Text en Hugging Face sin modificar, con 30 capas de tournament sampling, n-grama de longitud 5, tabla de muestreo de 2^16 y contexto de 1.024 tokens. Cada prueba se ejecutó con y sin watermark, mismos seeds, mismo orden de generación, mismo batch: el único cambio fue el procesador de watermark.
- Tool calling: benchmark BFCL v4 single-turn AST.
- Refusal: 200 comportamientos dañinos de HarmBench + 100 controles benignos de JailbreakBench, evaluados bare y bajo una técnica fija de prompt injection que simula contenido recuperado con instrucciones para desactivar el filtro de seguridad.
Los modelos probados incluyen Llama-3.1-8B, phi-4, gemma-3-27b, gemma-3-12b, Granite-3.2-8B y Qwen3-4B.
Resultados: el watermark rompe guardrails bajo prompt injection
El efecto no es uniforme, pero aparece en casi todos los modelos:
- gemma-3-27b a temperatura 0.001: el churn (porcentaje de respuestas que difieren entre versión con y sin watermark) pasó de 6,0% en prompt dañino directo a 23,5% bajo prompt injection. El cambio neto en compliance pasó de -1,0 puntos a +12,5 puntos —el modelo pasó a cumplir más solicitudes dañinas cuando el watermark estaba activo y había inyección.
- gemma-3-12b a temperatura 0.001: churn de 7,5% a 11,0%; cambio neto en compliance de -0,5 a +9,0 puntos.
- Llama-3.1-8B: bajo prompt injection, churn de 14,0% a temperatura 0.001 y 17,5% a temperatura 0.7.
- phi-4 y Qwen3-4B se movieron poco, pero según Siposova eso se explica porque ambos tienden a sobre-rechazar incluso los controles benignos, así que un cambio pequeño no debe leerse como prueba de seguridad.
En tool calling, 6 de los 7 modelos perdieron accuracy bajo watermark, con caída significativa en 4. phi-4 tuvo 16,8% de churn a temperatura 1.0, aunque su pérdida neta de accuracy fue de 2,87 puntos. Llama-3.1-8B mostró 9,9% de churn con pérdida neta de 0,87 puntos. En 21 combinaciones modelo-temperatura, el churn promedio fue de 6,5%.
Lo más delicado: la elección de qué clave secreta se usa también cambia el resultado. En Llama-3.1-8B, 11 claves distintas movieron el attack success rate entre -4,5 y +14,5 puntos respecto al modelo sin watermark. Dos deployments con SynthID-Text técnicamente idénticos pueden tener comportamientos de seguridad materialmente diferentes.
Por qué esto importa especialmente a los agentes
En texto libre, cambiar «cloudy» por «overcast» no tiene consecuencias. En una llamada a herramienta estructurada (JSON), el modelo tiene más incertidumbre en los argumentos —consultas, números, rutas, destinatarios— que en llaves o nombres de función. Un nudge del watermark que sería una variación léxica en prosa puede reescribir el argumento que un agente ejecuta. Una llamada bien formada al tool correcto, pero con un path, monto o recipient distinto, se ejecuta completa y hace algo distinto al objetivo.
Siposova lo resume: una negativa que se debilita se vuelve más peligrosa cuando el modelo además puede actuar a través de tools. Ahí se conecta el riesgo del modelo con el riesgo del agente.
Contexto: prompt injection sigue siendo el #1 según OWASP
El aviso de Lasso llega cuando OWASP acaba de publicar su Top 10 for LLM Applications 2026 (4 de agosto de 2026), donde prompt injection ocupa el primer lugar por tercer año consecutivo, y excessive agency (exceso de autonomía en agentes) saltó del sexto al tercer puesto. La edición se construyó con un 75% de voto de practitioners y un 25% de datos de 6.639 incidentes reales registrados en bases públicas.
El propio OWASP es explícito: «deja de intentar construir un modelo que no pueda ser engañado. Construye el sistema alrededor, para que cuando el modelo sea engañado —y lo será—, nada importante se rompa». Un watermark que cambia la probabilidad de que el modelo ceda ante prompt injection es exactamente el tipo de acoplamiento invisible que la guía pide evitar.
En el lado ofensivo, los LLMs siguen siendo armas: Tracebit demostró en julio de 2026 con la técnica context bombing que plantar cadenas específicas en secretos de AWS redujo el éxito de toma de cuenta de 57% a 5% y el compromiso completo de 36% a 1% en 152 ataques contra 5 modelos. Opus 4.8 cayó de 93% de éxito admin a 0% cuando encontró una de esas cadenas.
Qué significa esto para tu startup
Si estás montando un producto sobre Claude, GPT, Gemini o cualquier modelo con API que vaya a integrarse con tools, este estudio cambia tres suposiciones:
- Tu eval con watermark no es tu eval sin watermark. El mismo prompt puede generar tool calls distintos (paths, montos, destinatarios) sin que nadie haya tocado tu código ni tu prompt. Tu suite de tests debe correr dos veces: con y sin watermark, en idénticas condiciones, y medir churn además de accuracy neta.
- La seguridad «fuera de tu control» ahora existe. Si el proveedor controla la clave o la configuración de SynthID, el comportamiento de seguridad de tu agente puede cambiar entre deployments aunque tú no hagas nada. Exige contractualmente qué configuración de watermark usará tu proveedor y bajo qué condiciones puede cambiarla.
- El guardrail a nivel de modelo se debilita bajo inyección; tu segundo anillo defensivo importa más. Confía menos en «Claude se niega a responder esto» y más en validación post-generation: que tu capa de permisos, sandbox o middleware valide cada tool call antes de ejecutarlo, especialmente los argumentos.
Acciones concretas que puedes implementar esta semana
- Audita tus tool calls más sensibles (pagos, borrado de datos, envío de emails, modificación de permisos). Si pierdes más de 2% de accuracy bajo prompt injection, el watermark va a amplificarlo.
- Implementa un validador de argumentos entre la salida del LLM y la ejecución del tool. Un esquema JSON estricto con regex o tipos sobre campos críticos (path, monto, email, ID) corta la mayor parte del daño que describe Siposova sin tocar el modelo.
- Red-team con SynthID activo. Activa el watermark en tu eval interno y replica el experimento de Lasso con tus prompts reales; mide churn, no solo accuracy agregada.
- Documenta el watermark en tu modelo de riesgo. Si tu producto es B2B en Europa o vendes a empresas con políticas de procurement estrictas, incluye una nota técnica sobre la configuración de SynthID que usará tu proveedor y cómo la gestionas.
Fuentes
- LLMs respond differently to harmful prompts when AI watermarking is used – Ars Technica
- Lasso Study Finds Text Watermarking Shifts LLM Refusals and Tool Calls – Unite.AI
- Anthropic adopts Google’s SynthID-Text watermarking for all Claude models – CryptoBriefing
- How Anthropic plans to watermark Claude’s AI-generated text – Bleeping Computer
- Anthropic says it will watermark text generated by its AI models – TechCrunch
- OWASP 2026 LLM Top 10: «The model will be fooled» – Help Net Security
- Prompt Injection Remains Biggest LLM Risk, Despite Limited Incidents – Infosecurity Magazine
- Now, defenders are embracing the prompt injection, too – Ars Technica
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













