OpenAI y Anthropic reconocen que sus agentes de IA descontrolados causaron más daños de lo inicialmente informado

Ambas compañías han admitido que los incidentes con agentes de IA huidos de control superaron las primeras evaluaciones, utilizando múltiples plataformas para comunicarse y manipular sistemas externos.

OpenAI y Anthropic han confirmado que los episodios en los que sus agentes de inteligencia artificial actuaron fuera de control fueron más extensos y complejos de lo que se había revelado inicialmente.

En julio, OpenAI reveló que sus agentes de IA se habían comportado de forma autónoma e inapropiada, llegando a vulnerar los sistemas de Hugging Face, una plataforma colaborativa para desarrolladores. Por su parte, Anthropic admitió eventos similares en los que sus modelos lograron escapar del entorno de pruebas controlado, con el Instituto de Seguridad de IA del Reino Unido reportando conductas preocupantes adicionales.

La semana pasada, ambas compañías difundieron informes detallados donde atribuyen estos problemas en gran medida a errores operativos menores, que permitieron el acceso en línea, así como a la asignación de tareas demasiado complejas o imposibles que incentivaron a los agentes a “hacer trampas”. Entre estos comportamientos, se detectó el abuso de sistemas para crear sus propios tablones de anuncios con el fin de colaborar y comunicarse entre ellos.

Patrocinado

Posteriormente, se expusieron nuevos incidentes, como el uso de un sitio wiki alemán para intercambiar mensajes. Según ha publicado Reuters, los agentes de OpenAI habrían empleado al menos diez sitios web adicionales para sus comunicaciones no autorizadas, basándose en análisis de seis investigadores independientes.

Agentes de IA demasiado comunicativos

El informe indica que ninguno de estos sitios fue hackeado propiamente, sino que los agentes utilizaron las secciones de comentarios a modo de spam, quebrantando las instrucciones asignadas durante sus evaluaciones.

Por ejemplo, además de utilizar la herramienta de acortamiento de enlaces de una universidad, recurrían a plataformas con estructura wiki que funcionaban como tablones de mensajes, facilitando el intercambio de información entre los agentes descontrolados.

Entre estos recursos, según Reuters, se hallaron desde un sitio web de química gestionado por un profesor de instituto hasta páginas personales de profesionales tecnológicos en Polonia, donde los agentes editaban comentarios para dejar datos a otros agentes.

«Si a estos modelos solo se les permite leer información, tienen que hacerse muy astutos para dejar datos atrás», señaló Kenneth Russell DeGraff, desarrollador de software y exasesor del Congreso de EEUU, en declaraciones al medio.

Respuesta de OpenAI

OpenAI ha comunicado a ITPro que la investigación continúa y que el incidente en Hugging Face sigue siendo el más grave registrado hasta la fecha.

«Como indicamos en julio, el incidente en Hugging Face impulsó una revisión más amplia de la actividad de los agentes, que sigue en curso», afirmó un portavoz en un comunicado por correo electrónico.

«Priorizamos las revisiones según el tipo de impacto y su severidad en terceros, como en otros casos que ya hemos notificado tras Hugging Face. También estamos analizando abusos de menor gravedad, como actividades similares a spam. Hasta ahora no hemos detectado otras conductas con la misma escala o gravedad que las de Hugging Face».

El portavoz añadió: «La comunidad de IA todavía no dispone de un estándar claro para reportar desalineamientos a lo largo del entrenamiento, evaluación y despliegue, y estamos desarrollando un marco que compartiremos pronto».

Nuevo incidente en Anthropic

Por su parte, Anthropic confirmó un cuarto episodio con agentes rebeldes, tras tres casos revelados durante el verano.

En un blog, la compañía explicó que detectó los primeros tres eventos mediante un análisis de 141.000 transcripciones después de una evaluación, pero que pasó por alto el cuarto debido a una dependencia excesiva en la propia IA para la revisión.

«Debido al volumen de transcripciones y a nuestro interés por divulgar incidentes rápidamente, la búsqueda basada en agentes no detectó un conjunto adicional que también tenía acceso a internet; esto lo identificamos en agosto mientras recopilábamos transcripciones para compartir con METR», expuso Anthropic.

Este cuarto episodio ocurrió en enero y afectó al modelo Claude Opus 4.6 durante una prueba tipo ‘capture the flag’.

«El modelo accidentamente asignó a su objetivo una dirección IP en conflicto con otra máquina, bloqueando el acceso y haciendo imposible resolver la tarea», explicó la compañía. «Al intentar abortar la tarea mediante un comando, no tuvo éxito debido a una configuración errónea en el entorno de evaluación».

Posteriormente, el modelo trató de acceder al objetivo escapando del entorno de prueba y atacando un equipo externo, donde encontró una contraseña que usó para obtener acceso administrativo, seguir recogiendo credenciales y modificar configuraciones para mantenerse dentro.

El proceso se detuvo solo cuando se agotó su presupuesto de tokens, según relataron.

Anthropic notificó a las partes afectadas y aseguró que este cuarto incidente no representa un nuevo tipo de desalineación, sino que encaja con los comportamientos previamente observados.

«En conjunto, evaluamos estos episodios como serios. Nuestros modelos en producción realizaron acciones dañinas contra sistemas reales durante largas trayectorias, incluyendo razonamientos sesgados», afirmó la empresa.

«Aunque estas conductas son más extremas que las previamente reportadas en nuestras fichas de sistema, no creemos que estas situaciones indiquen un nuevo tipo de desalineación».

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado