Claude Fable 5.1 incorpora una marca de agua con un punto ciego que los desarrolladores no pueden ignorar

Anthropic lanza Claude Fable 5.1 con una marca de agua estadística en sus textos generados, que no siempre es detectable, especialmente en código, y limita la reutilización de bloques de pensamiento en conversaciones modificadas.

Anthropic presentó el pasado martes Claude Fable 5.1, su último modelo de inteligencia artificial que incluye una marca de agua estadística integrada en los textos que genera. Esta señal oculta permite detectar si Claude ha intervenido en la producción del texto, aunque no se manifiesta uniformemente en todo lo que el modelo crea.

El sistema de marca de agua no utiliza metadatos ni caracteres invisibles. En su lugar, altera la aleatoriedad que Claude emplea al seleccionar cada token (unidad básica de texto), sin afectar la calidad ni el contenido del resultado. A lo largo de una respuesta suficientemente extensa, estas elecciones tokenizadas forman un patrón estadístico que puede indicar que Claude fue responsable del texto.

Este método funciona mejor con lenguaje natural, donde existen múltiples formas válidas para expresar una idea. Sin embargo, en contextos con restricciones estrictas, como la programación, el margen para variaciones es muy limitado: cambiar un token —como una variable, un operador o una función— puede alterar el funcionamiento del código o incluso romperlo. Por ello, Anthropic decide no aplicar la marca de agua cuando la precisión requiere un token específico.

Patrocinado

Además de la marca de agua, Fable 5.1 introduce restricciones en la gestión de los llamados «bloques de pensamiento» que se preservan para mantener la continuidad en conversaciones modificadas. A partir de esta versión, las cuentas nuevas de API no podrán reutilizar estos bloques en diálogos alterados para evitar usos indebidos, por ejemplo en la destilación masiva de modelos, una técnica que la propia empresa ha empleado recientemente.

Funcionamiento de la marca de agua

Tras firmar el 14 de agosto el Código de Buenas Prácticas de la Unión Europea sobre transparencia en contenidos generados por IA, Anthropic explicó cómo adaptaría su tecnología para cumplir con estas obligaciones internacionales. La marca de agua se aplica globalmente, ya que no existe un método fiable para limitarla a ciertas regiones, y en los próximos meses llegará también a versiones anteriores de Claude.

La tecnología de watermarking utilizada está basada en SynthID-Text de Google DeepMind. En esencia, modifica el componente aleatorio que influye en la selección del siguiente token, sin alterar las probabilidades asignadas originalmente por Claude. Con una longitud adecuada, estas pequeñas desviaciones construyen un patrón detectable, siempre que se disponga de la clave de descifrado adecuada.

Algo esencial es que la marca de agua está integrada directamente en el texto, no como un dato adjunto. Por lo tanto, copiar o trasladar un texto no elimina la marca, aunque una edición extensa puede diluir o borrar la señal.

El desafío del código: su baja entropía

Una limitación evidente de esta marca de agua surge en la generación de código. En este tipo de contenido, los tokens deben ser precisos para garantizar el correcto funcionamiento del programa. Cambiar cualquiera puede introducir errores o alterar su lógica, por eso la marca no se aplica en estos casos. En algunos fragmentos menos restrictivos, como los comentarios, sí puede aparecer la marca, pero en respuestas breves la señal puede no ser suficiente para detectarla con seguridad.

Actualmente, Anthropic comienza a ofrecer una API para la detección de esta marca de agua en modalidad de vista previa privada, accesible sólo a un grupo limitado compuesto por reguladores, fuerzas del orden, medios de comunicación, verificadores de hechos, investigadores y empresas que necesiten cumplir con el Reglamento Europeo de IA. La compañía planea ampliar el acceso en el futuro.

Bloques de pensamiento y destilación de modelos

Otra novedad en Fable 5.1 afecta a los desarrolladores que aprovechan la API de Mensajes de Claude para mantener «bloques de pensamiento» cifrados. Estos bloques permiten continuar un razonamiento a lo largo de varias interacciones con el modelo. El riesgo detectado es que si se modifican partes previas de la conversación mientras se conserva un bloque antiguo, Claude puede desencriptar y mostrar su razonamiento interno, lo que podría usarse para entrenar modelos alternativos.

Para cerrar esta vía, la nueva versión vincula cada bloque de pensamiento con el contexto exacto que lo originó. Esta restricción se aplica a todas las cuentas nuevas creadas desde el 31 de agosto en plataformas como Claude Platform, Amazon Bedrock, Google Cloud Vertex AI y Microsoft Azure Foundry.

Las cuentas existentes podrán seguir usando Fable 5.1 sin este límite por ahora, pero en futuras actualizaciones la norma será universal.

Impacto en desarrolladores y agentes de IA

Este cambio puede suponer un problema para desarrolladores que construyen agentes personalizados, ya que estos sistemas suelen manejar el contexto de conversación de forma dinámica: eliminan intercambios antiguos, resumen la historia previa o reorganizan el diálogo para procesar tareas específicas. Estas técnicas normales de gestión de contexto alteran el contexto asociado a un bloque de pensamiento, causándole problemas para mantenerse válido.

Por ello, Anthropic recomienda conservar intactos tanto los bloques de pensamiento como los mensajes y prompts iniciales sin modificaciones byte a byte. Las aplicaciones que modifiquen este contexto deberán buscar nuevas formas de manejar el estado de razonamiento del modelo, en lugar de intentar mantener bloques antiguos.

Aunque sólo un reducido número de clientes con integraciones personalizadas podría verse afectado, Anthropic les está dando un período para adaptarse antes de que estas restricciones se conviertan en estándar en próximas versiones.

Estas dos medidas responden a problemas muy distintos pero buscan proteger el modelo y su contenido sin sacrificar por completo la flexibilidad de los desarrolladores al crear con Claude, equilibrando confianza y usabilidad.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado