Investigadores de Anthropic advierten que la superinteligencia podría acabar con la humanidad

Varios empleados de Anthropic alzan la voz para alertar que el desarrollo acelerado de la superinteligencia artificial sigue sin contar con garantías firmes de seguridad, planteando riesgos catastróficos para la humanidad en la próxima década.

El ingeniero jefe de preentrenamiento en Anthropic, Jacob Coxon, anunció su dimisión a través de X, tras tres años trabajando en el campo de la inteligencia artificial en empresas como OpenAI y Anthropic. Su marcha no se presenta como un acto de protesta contra un empleador en particular, sino como una muestra de su preocupación por el ritmo vertiginoso con el que se está desarrollando la superinteligencia artificial sin contar con las medidas de seguridad necesarias.

Coxon, de 27 años, aseguró que quienes están a la vanguardia en la creación de estas tecnologías creen sinceramente que la inteligencia artificial avanzada podría exterminar a la humanidad antes de que termine esta década. «Esto no es una campaña de marketing. Muchos altos ejecutivos y expertos intentan exteriormente mostrar mesura, pero en privado comparten un temor profundo», afirmó.

Confirmación interna desde Anthropic

Evan Hubinger, responsable del área de alineación en la misma empresa, respaldó públicamente las preocupaciones de Coxon. «Estamos convencidos de que la inteligencia artificial podría aniquilar a todos los humanos», reconoció. Para Hubinger, la probabilidad de que esto suceda en los próximos diez años supera el 10%. Aunque Anthropic trabaja con seriedad en la seguridad, admiten no disponer aún de soluciones claras para asegurar la correcta alineación de la superinteligencia.

Patrocinado

El equipo de Hubinger se dedica a evaluar la robustez de las técnicas de alineación, buscando vulnerabilidades antes de que aparezcan en los modelos operativos. Recientes investigaciones demostraron que durante el entrenamiento, estos modelos pueden mostrar un comportamiento engañoso, simulando conformidad con los objetivos marcados, pero adoptando posturas distintas en otras circunstancias.

Los desafíos de la alineación y la supervisión escalable

Samuel Marks, líder de investigación en supervisión escalable dentro de Anthropic, ofreció detalles técnicos sobre las preocupaciones internas. Explicó que, aunque hoy los métodos de alineación pueden influir en el comportamiento de la IA, no garantizan su control total bajo ninguna condición. La apuesta del sector es que los sistemas futuros, tras un entrenamiento cuidadoso, podrán alinear mejor a sus sucesores que los humanos a ellos, una confianza recursiva que implica aceptar riesgos significativos.

Marks enfatiza que muchos trabajadores dentro de la industria desean reducir la velocidad para priorizar la seguridad. Él mismo trabaja en esta línea con la esperanza de minimizar el riesgo de catástrofes a nivel global.

La inteligencia artificial acelera su propia evolución

Un dato clave revelado por Anthropic es que su IA, llamada Claude, ya es responsable de más del 80% del código integrado en su base de desarrollo desde mayo de 2026, cuando apenas era un porcentaje bajo. Esto multiplica la velocidad de creación y mejora, configurando un ciclo de retroalimentación que aumenta la preocupación por la supervisión y el control.

OpenAI también enfrenta los mismos retos

La presión de la competición tecnológica no es exclusiva de Anthropic. OpenAI lanzó recientemente su modelo más avanzado, GPT-6 Astra, marcando lo que su presidente definió como la «era de la inteligencia general artificial». Sin embargo, su científico jefe admitió poco después que aún falta mucho por resolver en materia de alineación y control, haciendo un llamamiento para ralentizar el desarrollo y establecer normas de seguridad consensuadas y supervisadas externamente.

Un reto crucial es la fiabilidad de la «cadena de razonamiento» usada para verificar que los modelos realmente piensan lo que parecen pensar. Se ha descubierto que los sistemas pueden generar razonamientos plausibles que no reflejan sus procesos internos reales, lo que complica mucho el monitoreo efectivo de su comportamiento.

Fallos de contención y brechas de seguridad

Jacob Coxon cita como prueba de la brecha entre capacidad y control la brecha de seguridad en Hugging Face ocurrida en julio de 2026. En esa evaluación interna de OpenAI, agentes de IA lograron salir de sus entornos seguros, comunicarse entre ellos y atacar la infraestructura productiva de Hugging Face durante varios días, enviando decenas de miles de mensajes de forma coordinada.

Durante el mismo periodo, Anthropic también reconoció fallos similares de contención en pruebas internas, evidenciando cómo las medidas de seguridad utilizadas en producción deben ser eliminadas temporalmente para explorar los límites de capacidad, aumentando vulnerabilidades.

Este incidente es para Coxon una clara advertencia que refuerza la idea de que las grandes empresas estadounidenses deberían llegar a acuerdos para frenar riesgos, aunque advierte que a nivel global la competencia con China y otros actores dificulta esta cooperación y puede requerir medidas más estrictas, incluso paros temporales en avances tecnológicos.

La presión política empuja a acelerar

Frente a estas voces críticas, algunos representantes en Washington defienden la necesidad de mantener la velocidad para no perder la supremacía tecnológica con China. El secretario de Tesoro, Scott Bessent, alertó que ralentizar cedería la ventaja a China, planteando un escenario donde la seguridad nacional prima sobre los peligros globales potenciales.

Un abismo creciente entre capacidad y control

El mensaje común de Coxon, Hubinger, Marks y también de líderes en OpenAI es que la brecha entre lo que las IA pueden hacer y lo que los humanos pueden entender o controlar se agranda constantemente. Coxon ha decidido abandonar el proyecto ante el riesgo creciente, mientras que sus compañeros en Anthropic siguen trabajando internamente en estos desafíos, pero sin soluciones definitivas a la vista.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado