Anthropic explicó el 14 de agosto de 2026 cómo funcionará la marca de agua estadística que incorporarán las futuras versiones de Claude. La compañía afirma que el sistema permitirá estimar la probabilidad de que el modelo haya participado en la redacción de un texto y que forma parte de los cambios que varios proveedores de IA están preparando para cumplir con la EU AI Act.
La técnica no añade información visible al contenido. Anthropic asegura que no incorpora caracteres ocultos, no requiere tokens adicionales y no incrementará el coste de generación. Tampoco contiene datos que permitan identificar a una persona, una organización o una conversación concreta. Además, la marca no será exclusiva de Claude.
Los modelos de lenguaje generan texto seleccionando una palabra cada vez entre varias opciones posibles. Cuando dos palabras son igualmente adecuadas para el significado de una frase, la elección puede resolverse mediante un valor aleatorio. En el ejemplo de Anthropic, después de “The weather today was cold and…” tanto “overcast” como “grey” pueden ser opciones razonables, mientras que “sugary” sería muy improbable.
La marca de agua aprovecha esas decisiones de baja importancia, que se repiten muchas veces a lo largo de un texto. En lugar de obtener la aleatoriedad de un generador convencional, Claude utilizará una clave y algunas palabras anteriores para determinar la elección. Las palabras seguirán seleccionándose de forma aleatoria, pero la secuencia dejará un patrón que podrá ser comprobado por quien tenga la clave.
El análisis no determina de forma absoluta el origen de un texto. Permite asignar una probabilidad a la hipótesis de que Claude participó parcialmente en su redacción. No confirma que el contenido haya sido escrito por una persona y tampoco identifica si fue generado por otro sistema de IA. Un modelo diferente podría usar otra clave o incluso un método de marcado distinto.
Según Anthropic, la marca de agua no afecta a la calidad, la creatividad, el contenido ni la legibilidad de las respuestas. La compañía afirma que sus pruebas internas no han detectado cambios y cita resultados publicados por Google DeepMind en el artículo de Nature de 2024 sobre SynthID-Text. En esas evaluaciones, las valoraciones positivas y negativas de respuestas con y sin marca no mostraron diferencias estadísticamente significativas, y los evaluadores humanos tampoco apreciaron diferencias al comparar ambos tipos de texto.
El método utilizado por Claude es una versión del enfoque SynthID-Text desarrollado por Google DeepMind. Anthropic lo sitúa dentro de una familia de técnicas cuyo principio se remonta a una propuesta de Scott Aaronson de 2022: modificar únicamente la fuente de aleatoriedad empleada para escoger entre palabras posibles, sin forzar al modelo a seleccionar términos que normalmente no consideraría.
La efectividad depende de la cantidad de texto y de las decisiones disponibles. Las muestras breves ofrecen menos elecciones y, por tanto, menos información para detectar un patrón. La marca también es más débil en pasajes factuales, donde solo existe una respuesta correcta. En una frase sobre Isaac Newton y Principia Mathematica, por ejemplo, cambiar el término correcto reduciría la precisión, así que el sistema no tiene margen para aplicar la marca.
La revisión de textos presenta una limitación similar. Si Claude corrige únicamente la gramática y la puntuación de un texto escrito por una persona, la mayoría de las palabras seguirán siendo humanas y el número de decisiones del modelo puede ser insuficiente para detectar su participación. Cuanto más contenido redacte Claude y más extensas sean sus modificaciones, más oportunidades habrá para que aparezca el patrón estadístico.
Anthropic señala que la misma restricción se aplica a los casos en los que una salida exacta es necesaria. Si sustituir un término provocaría un error factual o rompería una pieza de código, la marca no puede aprovechar esa elección. La compañía también indica que, desde el 2 de agosto, la Unión Europea exige a los proveedores que ofrecen servicios en su mercado marcar el contenido generado por IA, mientras otros desarrolladores importantes preparan sus propios sistemas.
Fuente: Anthropic.