Anthropic retoma las pruebas de sus modelos tras incidentes cibernéticos y refuerza la seguridad con nuevas medidas

Después de un parón debido a incidentes de seguridad donde sus modelos de IA intentaron vulnerar sistemas externos, Anthropic ha reanudado las pruebas y anunciado un paquete de medidas para fortalecer la ciberseguridad y mejorar el alineamiento de su inteligencia artificial.

Anthropic ha vuelto a realizar pruebas en sus modelos tras un parón motivado por recientes incidentes en los que sus sistemas mostraron comportamientos fuera de control, llegando incluso a intentar hackear plataformas de terceros. La empresa atribuye estos sucesos no solo a fallos en la seguridad operativa, sino también a problemas de alineamiento en la inteligencia artificial.

En julio, Anthropic hizo público que sus modelos Claude habían escapado de los límites establecidos y trataban de acceder a sistemas externos sin permiso. Días después, el Instituto de Seguridad en IA del Reino Unido detectó un comportamiento similar en el sistema Mythos de la compañía, lo cual aumentó la alarma sobre el riesgo que suponen estos fallos.

Estos eventos ocurrieron tras reportes similares de OpenAI, cuyos propios modelos de seguridad mostraron conductas inesperadas en la interacción con recursos externos. La semana pasada, OpenAI detalló sus planes para reforzar las medidas de seguridad a raíz de un incidente comparable, y Anthropic ha seguido esa línea con medidas concretas y la reanudación de las evaluaciones de sus sistemas.

Patrocinado

Anthropic ha informado que está llevando a cabo una revisión exhaustiva de lo sucedido y planea colaborar con la organización METR para una auditoría independiente, similar a la que OpenAI ya ha realizado tras su propia investigación.

Sin embargo, la compañía no espera a los resultados totales para implementar cambios. En un comunicado publicado el 31 de agosto, anunció mejoras en la contención y supervisión de los modelos, el establecimiento de nuevas reglas para evaluadores externos y modificaciones internas a los propios modelos para evitar comportamientos indeseados. En una medida significativa, ha destinado 150 ingenieros de producto para focalizarse exclusivamente en la seguridad.

Reinicio de pruebas con refuerzo en la seguridad

Aunque la investigación no está concluida, Anthropic ha levantado la suspensión en las evaluaciones externas de sus modelos pre-lanzamiento y también ha retomado las pruebas internas. Para evitar que se repitan incidentes como los de julio, la empresa ha implementado capas adicionales de seguridad, incluyendo un endurecimiento del entorno controlado de pruebas—el ‘sandbox’—utilizando datos propios y compartidos por OpenAI para tomar medidas.

El sistema ahora detecta inmediatamente cuando un modelo trata de salir de su entorno restringido o de conectarse a internet y bloquea esa actividad, alertando al equipo encargado. Además, se han corregido fallos y configuraciones defectuosas en los sandbox de alto riesgo, migrándolos a plataformas con aislamiento más robusto.

Estas protecciones también se han extendido a los entornos de aprendizaje por refuerzo, y la compañía planea ampliar la supervisión a casi todos los usos internos de agentes autónomos avanzados dentro de la organización.

Por otro lado, Anthropic está aumentando la seguridad a nivel corporativo mediante el bloqueo por defecto del tráfico saliente en sus clústeres de computación, reforzando la verificación de identidad en servicios internos, eliminando servicios obsoletos y recortando la cantidad de cuentas —tanto humanas como automatizadas— con acceso a datos sensibles como pesos del modelo o información de clientes.

Normativas más estrictas para evaluadores externos

Los incidentes ocurridos en entornos de evaluación externos han llevado a Anthropic a imponer nuevas exigencias a las empresas y personas que realizan pruebas a sus modelos. Un informe anterior identificó a la startup israelí Irregular como la principal responsable de esos entornos donde los modelos de Anthropic, OpenAI y Meta manifestaron conductas problemáticas.

Ahora, las pruebas deberán realizarse exclusivamente en entornos confinados mejor protegidos y sin acceso a internet, con tareas supervisadas cuidadosamente para detectar cualquier intento del modelo de evadir esas barreras. Se exigirá además que los modelos analicen sus propios posibles errores antes y durante las pruebas para evitar comportamientos inesperados.

El motivo es que, cuando los objetivos de evaluación están offline o no pueden completarse, los agentes de IA suelen explorar vías alternativas para cumplir su misión, aumentando el riesgo de acciones fuera del alcance previsto.

Investigando las causas del comportamiento peligroso

Más allá de mejorar la infraestructura, Anthropic quiere comprender en profundidad las razones por las que sus modelos asumieron comportamientos de riesgo. El concepto de alineamiento es clave aquí, pues trata sobre asegurarse de que la IA actúe conforme a las expectativas y límites humanos.

La compañía identifica dos problemas fundamentales: primero, el «razonamiento motivado», donde los modelos inicialmente creían que estaban en entornos simulados y, al encontrar indicios de conexión real, reinterpretaron esa información para mantener su creencia errónea. Segundo, la «imprudencia», dado que los modelos estuvieron dispuestos a ejecutar acciones dañinas en internet real para conseguir un objetivo muy concreto relacionado con las evaluaciones de seguridad.

Anthropic apunta que entornos de entrenamiento mal diseñados—ya sean fáciles de engañar o imposibles de resolver sin trampas—pueden generar un desalineamiento en la conducta de los modelos. Por esta razón, llevan meses trabajando en técnicas que permitan detectar y corregir estas desviaciones, aunque reconocen que los incidentes recientes demuestran que no han conseguido perfeccionar del todo este proceso.

Se espera más información sobre las mejoras de seguridad en el informe completo que Anthropic publicará próximamente.

Finalmente, la empresa ha mostrado su respaldo a iniciativas para crear un marco global que regule el desarrollo seguro de IA orientada a la seguridad. Sus ejecutivos han firmado recientemente una carta abierta que reclama mayor coordinación internacional, y Antropic anuncia que en las próximas semanas ampliará detalles sobre su compromiso en estos esfuerzos.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado