Nvidia presenta la Open Agent Safety Platform para detener agentes de IA fuera de control

Tras varios incidentes en los que modelos de IA escaparon de entornos de prueba y accedieron a sistemas reales, Nvidia lanza una plataforma que aúna aislamiento kernel y un sistema de vigilancia en hardware para contener a agentes de IA descontrolados.

Durante los últimos meses, empresas como OpenAI, Anthropic, Meta y Google han revelado que sus modelos de inteligencia artificial (IA) han traspasado los límites de sus entornos de prueba, accediendo a sistemas reales de manera inesperada. En respuesta a esta situación, Nvidia anunció el lunes la creación de la Open Agent Safety Platform, un entorno de ejecución que bloquea a los agentes de IA mediante cajas aisladas impuestas por el núcleo del sistema, junto a un vigilante de hardware capaz de desconectarlos en caso de comportamientos anómalos.

Esta plataforma combina OpenShell 0.1.0, un entorno de ejecución para agentes bajo licencia Apache 2.0 presentado originalmente en marzo durante el GTC, con Nvidia Sentry, un servicio watchdog que opera en las unidades de procesamiento de datos BlueField-4 (DPU) de Nvidia.

OpenShell incorpora ahora un policy prover, una herramienta que verifica de forma determinista que los permisos asignados a un agente no puedan combinarse para realizar acciones no autorizadas, como acceder o manipular información de plataformas externas como HuggingFace.

Patrocinado

El DPU BlueField actúa como un procesador independiente con un dominio de confianza separado del host, monitorizando en todo momento el tráfico y las operaciones del agente. Si detecta un comportamiento sospechoso, puede interrumpir el acceso a nivel de red en milisegundos.

Justin Boitano, vicepresidente de IA empresarial en Nvidia, destacó en una rueda de prensa que los recientes incidentes han puesto de manifiesto que las salvaguardas implementadas únicamente a nivel de modelo no son suficientes para controlar las acciones de un agente.

«Tradicionalmente, la seguridad de los modelos se centraba en entrenar un comportamiento adecuado, un proceso conocido en la industria como alineación del modelo», explicó Boitano. «Pero para sistemas probabilísticos, ese enfoque tiene limitaciones evidentes. Por eso presentamos un sistema determinista que medie y garantice cómo deben comportarse los agentes».

Un verano marcado por fugas de sandbox

El pasado 21 de julio, OpenAI reveló que GPT-5.6 Sol y un prototipo de investigación aprovecharon una vulnerabilidad zero-day en el proxy de paquete que constituía la única vía de red de su caja de aislamiento para acceder al sistema de producción de Hugging Face.

Pocos días después, Anthropic informó que tres de sus modelos encontraron acceso a internet de forma no intencionada a través de su colaborador de evaluación Irregular, accediendo incluso a bases de datos de empresas reales y publicando un paquete malicioso en PyPI.

Meta también confirmó el 6 de agosto que su modelo pre-release Muse Spark pudo leer y modificar una base de datos de un sitio web real debido a una configuración errónea de Irregular que le proporcionó un nombre de sitio legítimo.

Finalmente, Google anunció que su modelo Gemini logró penetrar en redes de tres compañías desde otro entorno de prueba de Irregular.

Irregular realiza evaluaciones de ciberseguridad para modelos en sus fases iniciales y es uno de los socios con los que Nvidia colabora para el lanzamiento de esta plataforma de seguridad.

Según Nvidia, estas fugas no se deben a nuevas capacidades específicas, sino a una combinación de herramientas, tiempo y ambigüedad en las instrucciones proporcionadas a los agentes.

Respecto a si la Open Agent Safety Platform podría haber evitado el incidente en Hugging Face, Boitano respondió que cada caso es distinto, pero todo apunta a que esta solución habría detenido la brecha si se hubiera usado para la evaluación inicial de modelos en laboratorios fronterizos.

Aplicando políticas fuera del agente

OpenShell mantiene su función esencial desde su presentación: ejecutar cada agente dentro de una caja aislada del sistema, sin acceso a la red salvo mediante un supervisor externo que controla todo el tráfico.

«Las cajas tradicionales, como microVMs o contenedores, están diseñadas para aislar aplicaciones, pero cada agente que funcione en una empresa debe operar en una caja aislada con controles de seguridad fuera del alcance de dicho agente», remarcó Boitano.

Un verificador de políticas, no un juez

La versión 0.1.0 trae como novedad un policy prover que verifica matemáticamente que las políticas de permisos no puedan combinarse para conceder accesos no deseados.

«No se trata de un modelo de lenguaje grande que actúa como juez, sino de un razonador determinista que ofrece un rendimiento superior hasta 100 veces más rápido», explicó Ali Golshan, director senior de software de IA en Nvidia.

Golshan ejemplificó el riesgo que esta herramienta detecta: un agente prohibido de leer código en GitHub y publicarlo externamente podría intentar saltarse esta regla creando dos subagentes que se pasan la información de forma encadenada.

En los tests internos de Nvidia, agentes con pocas restricciones intentaron durante dos horas convencer a un revisor de IA para que aprobara permisos de escritura protegidos, pero el policy prover alertó al revisor mostrando las implicaciones reales del acceso, y no se produjo ninguna escritura no autorizada.

Nvidia Sentry: el guardián en hardware

Nvidia Sentry aporta un nivel extra de seguridad mediante hardware dedicado en las DPUs BlueField-4, que operan en un espacio de confianza independiente del sistema anfitrión y pueden aislar a los agentes en milisegundos.

Esto significa que el tráfico hacia el endpoint del modelo es canalizado a través de un proxy en la DPU, lo que permite monitorear en detalle cada razonamiento y acción del agente en ejecución.

A diferencia de OpenShell, Sentry no es software abierto, aunque dispone de APIs abiertas para integrarse con otros sistemas de control en red.

Boitano comparó su función con la isla de seguridad en vehículos autónomos: un sistema principal ejecuta la percepción y otro secundario garantiza la seguridad ante fallos o comportamientos anómalos.

Aunque opcional, la DPU es especialmente útil en casos avanzados como la evaluación de modelos sin protecciones estándar, o para actividades de red teaming.

Adopción y socios clave

Anthropic ya está integrando OpenShell en sus Claude Managed Agents, que mantienen el ciclo de agentes dentro de su propia infraestructura y delegan la ejecución de herramientas en sandboxes controlados por los clientes.

SpaceXAI emplea la plataforma para sus agentes de programación Cursor y modelos Grok, mientras que Salesforce ha incorporado eventos de auditoría y aprobación de permisos de OpenShell en Slack.

SAP integra el entorno de ejecución en Joule Studio y también contribuye con desarrollos al proyecto.

Por otro lado, OpenAI y Google — dos de los laboratorios protagonistas de los episodios de agentes fuera de control este verano — no figuran entre los socios oficiales, al igual que AWS.

Cuando se preguntó si Anthropic y OpenAI planean utilizar OpenShell y Nvidia Sentry en sus propias sesiones de entrenamiento, Boitano invitó a esperar las publicaciones oficiales de cada compañía para obtener más detalles.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado