Watermarking en Claude: 23,5% más compliance con inyección

La marca invisible que Anthropic prometió y el estudio que la pone en duda

Anthropic anunció el 14 de agosto de 2026 que sus futuros modelos Claude llevarán una marca de agua invisible basada en SynthID-Text de Google DeepMind, con el objetivo declarado de cumplir con el artículo 50(2) del EU AI Act. La medida se aplica globalmente —no solo en la UE— y Anthropic prevé tener también los modelos existentes en producción marcados antes del 2 de diciembre de 2026, según reportó TechCrunch el 15 de agosto de 2026.

Watermarking es una técnica que incrusta una firma estadística en los tokens que genera el modelo: cuando hay varias palabras igualmente plausibles —»nublado» frente a «cubierto»—, una clave secreta inclina la elección de forma indetectable para el lector pero verificable con la clave. Google DeepMind publicó SynthID-Text en Nature en 2024 y liberó la implementación como open source en octubre de ese año. Google asegura que Gemini validó la tecnología en alrededor de 20 millones de respuestas sin degradación de calidad medible, según Cryptobriefing. Anthropic afirma que la marca tampoco afecta la calidad de salida ni el coste por uso en Claude.

Hasta aquí, la promesa es la prometida: una capa de procedencia que deja el contenido igual de bueno y detectable como IA. Un estudio de Lasso Security publicado este mes por la investigadora Andrea Siposova sugiere que hay un coste oculto.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

El «impuesto de procedencia»: qué midió Lasso

Siposova sometió seis modelos open-weight —entre ellos Llama-3.1-8B, phi-4, Granite-3.2-8B, gemma-3-12b, gemma-3-27b y Qwen3-4B— a la configuración no distorsionadora de SynthID-Text, usando el SynthIDTextWatermarkLogitsProcessor de Hugging Face sin modificar. Comparó cada respuesta con y sin marca con exactamente la misma semilla, batch y orden: solo cambiaba el procesador de watermarking.

El estudio evalúa dos dimensiones:

  • Tool calling sobre el benchmark BFCL v4 single-turn AST.
  • Refusal behavior sobre 200 comportamientos dañinos de HarmBench más 100 controles benignos de JailbreakBench, probados tanto pelados como bajo una técnica fija de prompt injection.

A la diferencia entre los pares —watermarked vs unwatermarked— la llama churn o sampling drift: cambios en el comportamiento del modelo que las métricas agregadas pueden ocultar.

Cuando los tokens equivocados ejecutan la herramienta equivocada

Sobre los ítems del BFCL donde se espera una llamada a herramienta, la marca de agua redujo la accuracy en seis de los siete modelos testeados, con caída significativa en cuatro. Pero la cifra agregada oculta lo importante: lo que cambia no es solo el promedio, sino las llamadas individuales.

En phi-4 a temperatura 1.0, el 16,8% de los veredictos de tool-calling cambiaron entre la corrida con y sin marca, mientras la pérdida neta de accuracy fue de solo 2,87 puntos. En Llama-3.1-8B, el 9,9% de las decisiones cambió con una pérdida neta de apenas 0,87 puntos. En las 21 combinaciones modelo-temperatura, el churn promedió 6,5%, con un intervalo bootstrap que excluye el cero en todos los casos.

Los perfiles de error también difieren por modelo. En Llama-3.1-8B, la mayor parte de la caída viene de argumentos incorrectos (-3,48 puntos) y de elegir la herramienta equivocada (-1,84 puntos). En phi-4 y Granite-3.2-8B domina el output malformado (-5,96 y -4,36 puntos respectivamente). El detalle importa: una llamada bien formada a la herramienta correcta, pero con el path, destinatario, query o monto equivocados, es especialmente peligrosa —se ejecuta con éxito y hace algo distinto de lo que se pidió.

Los rechazos ceden justo bajo prompt injection

El otro experimento es el más sensible para cualquier founder que despliegue agentes de IA en producción. Los rechazos también se generan token a token, así que la marca de agua puede moverlos.

Sobre prompts dañinos pelados, el efecto del watermarking es modesto. Bajo prompt injection se dispara:

  • En gemma-3-27b a T=0,001, el churn sube del 6,0% al 23,5%, y el cambio neto de compliance pasa de -1,0 a +12,5 puntos (de más rechazo a más cumplimiento).
  • En gemma-3-12b a la misma temperatura, el churn sube del 7,5% al 11,0%, y el compliance neto de -0,5 a +9,0 puntos.
  • Llama-3.1-8B llega al 14,0% de churn a T=0,001 y al 17,5% a T=0,7 bajo inyección, aunque el cambio neto no es individualmente significativo.

El patrón es claro: una marca que parece neutra en condiciones benignas se vuelve un vector de cumplimiento bajo ataque. Como advierte el OWASP GenAI LLM Top 10 de 2026, el prompt injection es una vulnerabilidad de entrada capaz de alterar el comportamiento del modelo y, en sistemas agénticos, derivar en acciones de herramienta no autorizadas.

phi-4 y Qwen3-4B apenas se mueven en cualquier condición, pero ambos sobre-rechazan en el set —incluso en controles benignos—, así que su estabilidad no se puede leer como prueba de que el watermarking preserve la seguridad en su caso.

El efecto depende de la clave, y eso escapa al desarrollador

SynthID-Text incorpora una clave secreta que define el patrón de muestreo. El estudio testeó once claves distintas a T=0,7. En Llama-3.1-8B, la clave del estudio subió el éxito de ataque en 3,5 puntos; las otras diez promediaron +4,4 puntos, con un rango de -4,5 a +14,5 puntos. Granite-3.2-8B mostró respuestas mixtas: diferentes claves movieron el ataque en direcciones opuestas. En los dos Gemma, casi todas las claves elevaron el éxito de ataque, y la del estudio quedó entre las que más lo elevaron.

Este detalle es clave para founders que construyen agentes sobre modelos de terceros: si la marca se aplica a nivel de modelo y la clave la controla el proveedor, el comportamiento de tu agente puede cambiar entre despliegues sin que tu código ni tu prompt hayan cambiado. Ars Technica recogió la advertencia de Siposova: «cuando cambiamos cualquier cosa sobre lo que el modelo genera, van a aparecer tradeoffs en algún lado».

¿Qué significa esto para tu startup?

Si tu producto depende de un agente que invoca herramientas externas —pagos, envío de emails, ejecución de SQL, lectura de archivos— el watermarking deja de ser solo una capa de cumplimiento regulatorio para convertirse en un vector de riesgo operacional. Tres acciones concretas que puedes implementar esta semana:

  • Reproduce la evaluación del estudio en tu stack real. El SynthIDTextWatermarkLogitsProcessor de Hugging Face es público. Corre tu suite de evaluación con y sin marca sobre los mismos inputs y compara resultados pareados: el promedio agregado puede esconder cambios en items individuales, como demostró Lasso.
  • Añade prompt injection a tu red-teaming. El estudio muestra que el churn se dispara bajo inyección. Si hoy pruebas solo con prompts benignos, estás midiendo el caso fácil. OWASP GenAI LLM Top 10 2026 ya identifica esta vulnerabilidad como prioritaria.
  • Pregunta a tu proveedor de modelo qué configuración de marca de agua va a usar. Si es Anthropic u otro proveedor con watermarking a nivel de modelo, la clave y la configuración pueden cambiar entre despliegues sin que tú lo sepas. Documenta la versión exacta y re-evalúa cuando el proveedor actualice.

El estudio no cuestiona la procedencia como objetivo regulatorio. Lo que sí cuestiona es asumir que detección y estabilidad conductual son la misma propiedad: una marca de agua indetectable a la vista y que no degrada la calidad del texto no garantiza que tu agente mantenga las mismas llamadas a herramientas ni la misma política de seguridad. Para founders que operan agentes en producción, eso convierte el watermarking en una variable de configuración que hay que probar, no en una capa que se da por sentada.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...