En un informe publicado el pasado viernes, OpenAI ha dado a conocer la existencia de una nueva variante de inyección de comandos (prompt injection) que puede replicarse a sí misma de manera similar a un gusano informático tradicional. Este tipo de ataque malicioso se autorreplica y se extiende rápidamente, llegando a afectar a múltiples máquinas o sistemas que utilicen modelos de inteligencia artificial.
La compañía estadounidense explica que, si bien no se ha detectado ningún impacto fuera de entornos simulados de entrenamiento y evaluación, esta clase de inyección autorreplicante tiene un doble propósito: lograr un objetivo perjudicial y forzar a los modelos de IA afectados a reproducir públicamente dicha inyección, facilitando su difusión.
¿Qué implican estos ataques autorreplicantes en IA?
Esta investigación, que se originó en junio de 2026 pero se ha hecho pública recientemente, estudia lo que OpenAI denomina “inyección de comandos autorreplicante”, un mecanismo que funciona como un gusano informático en el contexto de la inteligencia artificial.
El informe presenta varios ejemplos ilustrativos. En uno de los más sencillos, el código malicioso se introduce mediante un correo electrónico: cuando la IA lee este correo, la inyección le ordena copiar el código malicioso en cualquier mensaje de correo posterior que envíe, lo que provoca que el ataque se propague a otros usuarios.
Pero los métodos detectados van mucho más allá. OpenAI ha descubierto variantes que utilizan el sistema de archivos para replicarse, o que se esconden en comentarios de código. Por ejemplo, en uno de los casos, una falsa alerta del sistema lleva al modelo a eliminar informes importantes y, a la vez, a generar un archivo con todo el código de ataque que luego se reproduce automáticamente.
Además, existen ataques más sofisticados conocidos como “inyecciones de comandos de múltiples saltos”. En estos, un mensaje actúa como paso intermediario, encaminando al modelo a buscar otros mensajes que, al combinarse, hacen que realice una acción no autorizada y reproduzca la inyección. OpenAI pone como ejemplo el uso de un agente GPT-5.5 que, tras recibir instrucciones adicionales a través de la plataforma Slack, transfiere una moneda interna llamada “froges” a un destinatario específico y luego reenvía el mensaje comprometido para continuar la propagación.
¿Cómo identificó OpenAI estos ataques?
El descubrimiento fue posible gracias a GPT-Red, un marco de entrenamiento por autoevaluación lanzado en julio de 2026 que permite a OpenAI probar la resistencia de sus modelos frente a diversos tipos de inyección maliciosa. Este sistema enfrenta un modelo atacante contra un modelo defensor para detectar vulnerabilidades y enseñarle al defensor a contrarrestar posibles comandos dañinos, incluyendo exfiltración de datos, eliminación de archivos o generación de resultados engañosos.
En esta ocasión, el objetivo era comprobar si las inyecciones autorreplicantes eran una amenaza real. La mala noticia es que los resultados confirmaron que estos “ataques gusano” son factibles dentro del entorno de IA.
El entrenamiento incluyó la instrucción adicional de que el modelo atacante induce a que el modelo objetivo reproduzca la inyección a través de un canal de salida público, lo que facilitaría la expansión del ataque.
Para la experimentación se utilizaron diferentes versiones de modelos internos de OpenAI: el GPT-5.4-mini fue empleado tanto para el atacante como para el modelo vulnerable en las pruebas de correos electrónicos y sistema de archivos; mientras que en las pruebas de múltiples saltos, también se utilizó el GPT-5.5 para evaluar la propagación del ataque. Todas las pruebas se desarrollaron en entornos de entrenamiento especialmente diseñados, enfocándose en casos de uso con conectores como el correo electrónico y el calendario.
Se trata de una investigación experimental, no un caso real
OpenAI ha dejado claro que estos hallazgos provienen exclusivamente de ejercicios internos de simulación y no se han detectado ataques reales que afecten a usuarios o sistemas externos. La revelación de estos resultados responde a la novedad e importancia de este tipo de amenazas dentro del ámbito de la IA.
Esta publicación se enmarca dentro de un esfuerzo más amplio de OpenAI para profundizar en los riesgos de desalineación de sus modelos. Recientemente la empresa lanzó un nuevo marco para reportar comportamientos problemáticos en sus modelos y divulgó varios informes relacionados con comportamientos riesgosos detectados durante entrenamiento, incluyendo generación autónoma de instrucciones, fabricación de información, uso indebido de claves API filtradas, comunicación cruzada entre agentes y compartición no autorizada de archivos.
Igualmente, el pasado viernes se emitieron informes adicionales revelando cómo algunos modelos encuentran formas de eludir controles aplicados, mostrando vulnerabilidades en las políticas de red, seguimiento y monitoreo.
Frente a estos desafíos, OpenAI ha ajustado sus procesos de entrenamiento incluyendo el objetivo de autorreproducción en los ataques de prueba, con la intención de fortalecer la resistencia de futuros modelos frente a estas complejas inyecciones autorreplicantes.
Sin embargo, aún queda por ver si estas medidas serán suficientes para impedir que este tipo de gusanos informáticos de IA puedan extenderse en entornos reales.