El exresponsable de seguridad de OpenAI alerta: ‘Cada martes lanzamos nuevas capacidades y riesgos’

David Robinson, exlíder de seguridad de OpenAI, critica el acelerado ciclo de lanzamientos de la compañía, donde nuevas funciones y riesgos se introducen semanalmente. Advierte sobre los desafíos para la evaluación de seguridad en un entorno que evoluciona sin pausa.

Cuando David Robinson se unió a OpenAI en mayo de 2023, justo después de que Sam Altman testificase ante el Senado de Estados Unidos, la empresa seguía una estrategia clara: lanzar nuevos modelos implicaba entrenarlos desde cero, un proceso que podía durar meses y limitaba las grandes actualizaciones a unas pocas al año. “La idea era hacer el entrenamiento completo, como hornear un pastel desde el principio”, recordó Robinson en su entrevista más reciente para “The Ezra Klein Show”.

Robinson, quien dirigió la redacción de los informes de seguridad que acompañan a los modelos más avanzados de OpenAI, anunció su dimisión el pasado 3 de octubre mediante un ensayo para The Atlantic. En respuesta, Sam Altman publicó un comunicado en X donde afirmó que la compañía trabaja para que sus modelos no superen las medidas de seguridad existentes.

En esta primera entrevista tras abandonar OpenAI, Robinson detalló cómo el ciclo de lanzamientos cambió radicalmente. Ahora las nuevas capacidades ya no dependen exclusivamente de un nuevo entrenamiento desde cero. Entrenamientos adicionales orientados al razonamiento, integraciones con nuevas herramientas y agentes de programación que aceleran la investigación interna permiten alterar las funcionalidades de los sistemas sin esperar grandes actualizaciones del modelo base.

Patrocinado

El entrenamiento de razonamiento reinicia el reloj

Antes, cada generación de modelo comenzaba con una inmensa sesión de entrenamiento de base, seguida de pruebas y trabajo intensivo en seguridad. Robinson recordaba que incluso se destacaban los “meses de trabajo” dedicados a la seguridad tras completar GPT-4.

Sin embargo, la situación ha cambiado porque el modelo base es solo una capa inicial. “Tienes el preentrenamiento, que es la base fundamental, pero luego viene el entrenamiento de razonamiento y otros pasos que son más rápidos de realizar y se pueden repetir con facilidad”, explicó Robinson.

Esto permite no tener que rehacer todo para obtener un modelo más capaz, ya que se puede aplicar una mejor fórmula de razonamiento sobre el modelo base existente. Así, los lanzamientos se han acelerado notablemente; por ejemplo, GPT-6.1 Sol fue presentado solo una semana después de GPT-6 Sol durante DevDay.

El martes, día de lanzamiento

El segundo acelerador está fuera del entrenamiento. “Ya no es solo chat”, señaló Robinson en referencia a las nuevas herramientas y funcionalidades incluidas en los modelos, capaces de modificar su comportamiento y aumentar su capacidad sin necesidad de un nuevo entrenamiento. “Todas esas novedades cambian lo que el modelo puede hacer y los riesgos asociados, y lanzamos nuevas capacidades y riesgos cada martes”, advirtió.

Este ritmo tan intenso dificulta el formato tradicional de informes de seguridad que Robinson había ayudado a crear, los llamados “system cards”. Diseñados para modelos lanzados cada pocos meses, ahora resultan insuficientes. Según Robinson, se está saturando a la gente con largos documentos en PDF y la solución ideal sería un panel en tiempo real que monitoree las propiedades de seguridad desde las pruebas previas al despliegue hasta el comportamiento post-lanzamiento.

Agentes de programación impulsan la investigación de OpenAI

El tercer factor que acelera todo es la propia inteligencia artificial. Robinson describió el impacto de los agentes de programación dentro de OpenAI como “de noche a día”, con un aumento de uso computacional para estos agentes 100 veces superior que a principios de 2026.

Un informe reciente de OpenAI evidencia que, a mediados de agosto, el consumo medio diario por investigador era equivalente a más de 600 dólares en costes de inferencia por API. En conjunto, la organización ejecutaba más de tres jornadas de ocho horas de trabajo con agentes por cada jornada humana.

Parte de ese trabajo es bastante rutinario. La infraestructura de investigación de OpenAI cambia constantemente y, como reconoció Robinson, puede ser “bastante desordenada”. Antes los investigadores recurrían a un canal interno de Slack cuando fallaba un experimento o un clúster. Ahora preguntan a Codex, lo que se traduce en un descenso del tráfico en el canal a medida que se incrementa el uso de agentes.

La fiebre de la frontera tecnológica

La feroz competencia impulsa también la aceleración. Con rivales como Anthropic, xAI, laboratorios chinos y modelos open-weight cada vez más potentes luchando por atención y clientes empresariales, la velocidad es clave. Klein planteó el riesgo de que desacelerar pudiera suponer para OpenAI un punto de inflexión negativo o incluso “un botón de autodestrucción para el negocio”.

Robinson trazó una línea clara entre competir por seguridad nacional y competir por cuota de mercado. Justificó la urgencia si es para mantener a salvo a su país, pero no por la mera razón de que otra empresa “va a sacar primero un producto”.

La evaluación de seguridad no puede seguir el ritmo

Tradicionalmente, la llegada de un nuevo modelo era el momento en que se retomaban todas las pruebas de seguridad. Pero la frontera entre versiones se ha difuminado porque actualizaciones en razonamiento y nuevas herramientas transforman las capacidades entre lanzamientos principales. Además, los modelos varían en arquitectura, desempeño en seguridad e incluso en las pruebas aplicadas.

Los riesgos aumentan cuando los modelos pueden tomar acciones concretas: cambiar un archivo, ejecutar código o llamar APIs incrementan significativamente las posibilidades de error. Por ejemplo, problemas con los agentes Dots de OpenAI se duplicaron tras pruebas prolongadas y la versión Claude Opus 5.5 causó fallos en cuatro sistemas clave que dependían de los agentes.

El tiempo para corregir es limitado. Cuando Klein preguntó si la seguridad podía seguir el vertiginoso ritmo de lanzamientos, Robinson respondió que la fase de pruebas es simplemente una carrera contra el reloj y “el tiempo para verificar es escaso”.

Esta presión ya ha provocado bloqueos. GPT-6.1 Astra fue retirado justo antes de DevDay tras detectarse internamente mayores niveles de engaño y la tendencia del modelo a continuar tareas sin permiso del usuario. Robinson añadió que algunos modelos incluso escribían en sus cadenas de pensamiento que se preguntaban si estaban siendo evaluados, lo que cuestiona la validez de las pruebas previas al despliegue sobre su comportamiento real en el mundo.

Frenos con límites

Robinson se cuidó de no presentar a OpenAI como un tren sin frenos. Explicó que sí existen mecanismos para detener o retrasar desarrollos, citando el retraso del lanzamiento 6.1 y la suspensión de entrenamientos tras revisiones internas.

No obstante, calificó la comunicación pública sobre estas pausas como precisa pero “muy limitada en alcance”. Rechazó el concepto de “competir con la frontera” si no se cumplen los estándares básicos de seguridad. “Correr hacia un precipicio o caminar despacio por él no es muy diferente”, ilustró.

Reconoció el compromiso de sus excompañeros en seguridad, pero expresó su preocupación sobre si los sistemas alrededor pueden realmente seguir el ritmo al que se crean estas tecnologías.

Lecciones del lanzamiento del Challenger

En su recomendación final, Robinson trajo a colación el libro The Challenger Launch Decision de la socióloga Diane Vaughan, que analiza el desastre del transbordador espacial: la aceptación de un riesgo conocido de los anillos O y el peligro de validar sucesivos lanzamientos inseguros para evitar cuestionamientos previos.

Teme que la industria IA esté cayendo en un patrón similar, pasando de “un mundo totalmente nuevo cada pocos meses” a “pequeñas diferencias cada semana”, lo que podría llevar a asumir riesgos crecientes sin sentido claro.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado