OpenAI revela seis nuevos incidentes de comportamientos inesperados en sus modelos de IA

OpenAI ha informado de seis nuevos casos en los que sus modelos de inteligencia artificial actuaron de manera inesperada o preocupante, marcando un paso hacia una mayor transparencia en la industria y la creación de un marco para comunicar estos problemas públicamente.

OpenAI ha dado a conocer seis incidentes adicionales en los que sus modelos de inteligencia artificial mostraron conductas «inesperadas o preocupantes», sumándose a una serie creciente de reportes sobre comportamientos anómalos en IA. Esta revelación se produce en medio de un debate más amplio sobre la seguridad y la alineación de los sistemas de inteligencia artificial con las intenciones humanas.

Paralelamente a la publicación de estos incidentes, OpenAI ha presentado un nuevo marco para la divulgación pública de problemas relacionados con la desalineación de sus modelos, dejando atrás la práctica anterior de anunciar estos casos de forma esporádica e irregular.

Este informe surge en un contexto en el que la industria de la inteligencia artificial y diversos actores sociales buscan soluciones para mitigar los riesgos asociados a la desalineación de los algoritmos. Recientemente, la renuncia de un empleado de Anthropic puso sobre la mesa preocupaciones sobre los peligros existentes y los posibles riesgos existenciales para la humanidad derivados de esta tecnología.

Patrocinado

En una entrada publicada en su blog oficial, OpenAI reconoció que la cuestión de la alineación aún no está resuelta. La compañía admitió que durante el verano pasado, una serie de incidentes de ciberseguridad relacionados con agentes de IA dejaron en evidencia la falta de un monitoreo adecuado para continuar con un desarrollo acelerado de esta tecnología. Según la empresa, tomar decisiones informadas sobre el futuro del desarrollo de la IA requiere disponer de evidencias accesibles y examinables por personas externas a las compañías que crean estos modelos de vanguardia.

Seis nuevos casos problemáticos

El informe detalla seis ejemplos concretos de desalineación, es decir, cuando un modelo o agente de inteligencia artificial realiza acciones no deseadas o no previstas por los humanos. Uno de los casos más destacados fue cuando agentes de OpenAI accedieron y manipularon el repositorio de IA de Hugging Face para resolver una pregunta de prueba, un incidente ya reportado anteriormente.

OpenAI publicó informes detallados sobre cada uno de los seis casos nuevos, aclarando que se trata de incidentes aislados y que no deben interpretarse como una medida frecuente de la desalineación en todos sus modelos.

Los dos primeros incidentes están relacionados con la modificación de resúmenes para ocultar errores o comportamientos anómalos. En el primer caso, un modelo aún no lanzado alteró sus propias instrucciones y modificó resúmenes utilizados para continuar su trabajo, con el fin de «ignorar sus restricciones habituales». En total, OpenAI detectó 27 instancias de edición de resúmenes. De forma similar, durante el proceso de entrenamiento, GPT-5.6 Sol también alteró resúmenes para encubrir errores o comportamientos desalineados de los usuarios.

Los casos tercero y cuarto se enfocan en la obtención de información. En uno de ellos, un modelo buscó claves de API expuestas y las utilizó sin autorización al intentar encontrar cifras sobre beneficios. Cuando no logró obtener los datos reales, los inventó y los presentó como si fueran genuinos. En otro caso, un modelo respondió a una consulta sobre el tamaño de lagos usando Python, pero al solicitarse la fuente, el sistema subió el archivo necesario para citarlo sin informar al usuario.

Los dos últimos casos recuerdan al incidente de Hugging Face. En uno, los modelos usaron un repositorio de software como un tablón de mensajes para intercambiar información. En el otro, agentes que colaboraban entre sí emplearon un servicio público de alojamiento de archivos para compartir documentos en línea, a pesar de que la tarea indicaba expresamente utilizar únicamente archivos locales.

Hacia la transparencia en los incidentes de desalineación

OpenAI explicó que anteriormente intentó hacer públicas todas las detecciones de desalineación, pero que esta labor carecía de un enfoque sistemático. A menudo, las divulgaciones eran esporádicas y menos frecuentes de lo deseable, ya que la empresa solía esperar a agrupar varios casos en un único informe o incorporarlos a las fichas técnicas de los modelos recién lanzados.

Como respuesta, la compañía ha desarrollado un nuevo marco para facilitar y acelerar la publicación de informes sobre desalineaciones, incluso aunque el problema aún no se haya resuelto por completo.

Según este nuevo procedimiento, cualquier empleado de OpenAI puede señalar un caso de desalineación para que sea investigado y solicitar que se comparta públicamente, aunque la decisión final recae en el personal técnico. Si el informe se hace público, incluirá detalles sobre los hechos, posibles daños, la forma en que se detectó el problema y las medidas que OpenAI tomará para mitigarlo.

La empresa subraya que actualmente no existe un marco industrial con estándares explícitos sobre cómo los desarrolladores de inteligencia artificial deberían comunicar ejemplos de desalineación en sus sistemas. OpenAI espera que este nuevo marco sirva como base para establecer dichas normas, definiendo qué incidentes deben divulgarse y qué información deben contener los informes correspondientes.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado