El pasado lunes, Anthropic presentó Claude Sonnet 5.5, su primer modelo de la serie Sonnet que incorpora salvaguardas específicas para la ciberseguridad junto con sistemas de retroceso (fallbacks) basados en clasificadores, mecanismos similares a los que ya emplea en sus modelos más avanzados. De esta manera, estas medidas de seguridad se integran ahora también en la gama de modelos que suelen usar muchos desarrolladores para cargas de trabajo en producción.
Según Anthropic, Sonnet 5.5 no supone un avance significativo en términos absolutos de capacidades respecto a versiones previas, aunque su rendimiento en tareas relacionadas con ciberseguridad es equiparable al del modelo Opus 5. En pruebas de evaluación de código automatizado (Terminal-Bench 4.0), Sonnet 5.5 alcanzó un 70,6% de eficacia frente al 66,4% de Opus 5.5 bajo su configuración de mayor esfuerzo (“xhigh”).
Este lanzamiento evidencia cómo un modelo puede mantener un nivel general inferior a los más potentes de Anthropic, pero mejorar lo suficiente en un ámbito específico —en este caso la ciberseguridad— como para requerir las mismas precauciones y mecanismos de seguridad que los modelos tope de gama.
Incremento en habilidades ofensivas y necesidad de nuevas salvaguardas
El documento técnico de Sonnet 5.5 revela avances notables en tareas de seguridad ofensiva, ya que sin activar sus protecciones, el modelo logró ejecutar código arbitrario completo en 178 de 410 pruebas realizadas con ExploitBench. Además, resolvió el 46,1% de los desafíos en CyScenarioBench —un notable salto frente al 0,7% alcanzado por Sonnet 5— y detectó 50 secuestros de flujo de control en un benchmark de explotación binaria derivado del corpus OSS-Fuzz de Google, frente a apenas tres casos por Sonnet 5.
Aunque Anthropic considera que Sonnet 5.5 sigue estando por detrás de Opus 5.5 y Mythos 5.1 en habilidades de ciberseguridad, la mejora respecto a Sonnet 5 es lo suficientemente significativa como para aplicar la misma política de seguridad usada para los modelos Opus 5 y Opus 5.5.
Mecanismo de protección en tres fases
La política de seguridad se articula en tres niveles: primero un sistema de monitoreo que lee las activaciones internas del modelo, seguido por un clasificador ligero integrado en Sonnet 5.5 y finalmente otro clasificador basado en un gran modelo de lenguaje entrenado externamente. Este último evalúa la información del primer clasificador para decidir si bloquear una conversación.
Los clasificadores identifican peticiones maliciosas relacionadas con la ciberseguridad con una tasa similar a los usados en Opus 5, aunque con menor agresividad en la protección contra ataques como jailbreaks, dado que Sonnet 5.5 no es tan avanzado en estas áreas como Opus 5 o Fable 5.1. La compañía avisa que, debido a estas nuevas salvaguardas, se incrementarán los rechazos en comparación con Sonnet 5, incluso en trabajos legítimos de seguridad informática.
Cuando se lanzó Sonnet 5, Anthropic activó protecciones por defecto similares a las de Opus 4.7 y 4.8. Esta tendencia se acentuó con la salida de Opus 5.5, considerado cercano a Mythos 5.1 en competencias de biología y ciberseguridad y equipado con salvaguardas semejantes a las de Fable 5.1.
Estos sistemas determinan qué modelo responde a cada solicitud, con peticiones de mayor riesgo derivadas de Opus 5.5 hacia Opus 4.8 y consultas relacionadas con biología o desarrollo avanzado de modelos dirigidas a Opus 5. La compañía reconoció que estas políticas suponen una disminución en los resultados de las pruebas de rendimiento cuando los filtros están activados.
Derivación de peticiones en Sonnet 5.5
Con el nuevo modelo Sonnet 5.5, este sistema de derivación se extiende también a la capa más económica, de modo que las peticiones bloqueadas por las salvaguardas relacionadas con ciberseguridad y algunas otras tareas técnicas, como trabajos con kernels para aceleradores de aprendizaje automático, se redirigen a Sonnet 5.
Anthropic explica que esta derivación se activa en situaciones consideradas “de mayor riesgo” en ciberseguridad, como pruebas de penetración, generación de exploits o escaneos de vulnerabilidades en binarios. En la documentación oficial se aclara que la mayoría de solicitudes no activa estos filtros y que las tareas rutinarias de desarrollo de software no se ven afectadas.
Por otro lado, bloqueos vinculados a temas biológicos, armas convencionales y detección anti-destilación (para evitar manipulaciones del modelo) terminan la solicitud sin opción de fallback. Anthropic asegura que estos bloqueos se aplican de forma transparente y sin modificar las respuestas del modelo de forma encubierta.
Mecanismo de fallback en la API y diferencias de uso
El comportamiento de fallback depende del contexto. En las aplicaciones propias de Anthropic, las solicitudes bloqueadas se envían automáticamente a Sonnet 5, mientras que para quienes usan la API esta función debe activarse manualmente. Otros proveedores pueden gestionar estas solicitudes con diferentes políticas. Los usuarios que emitan consultas que causen el cambio de modelo recibirán un aviso y la respuesta especificará qué modelo finalmente respondió.
Esto implica que para desarrolladores que migran de Sonnet 5 a Sonnet 5.5 no se trata simplemente de un cambio de modelo directo; sin habilitar el fallback, las solicitudes bloqueadas no se redirigen, sino que se detienen.
La política permite detectar vulnerabilidades en código fuente, manteniendo intactos los flujos de trabajo de codificación segura, pero bloquea el descubrimiento de vulnerabilidades en binarios compilados. Además, el sistema revisa todas las fuentes de información que el modelo lee, como la memoria, conectores, resultados de búsquedas web o ficheros, por lo que contenido no ingresado directamente por el usuario también puede activar el fallback. Para agentes que consultan repositorios o páginas web, cualquier información recuperada puede disparar las protecciones.
Riesgos adicionales por fallback y vulnerabilidades a inyecciones de instrucciones
El uso de fallback genera un punto débil adicional: la posibilidad de inyección de instrucciones maliciosas (prompt injection). En pruebas realizadas, el 25% de las solicitudes enviadas a Sonnet 5.5 que fueron bloqueadas y redirigidas a Sonnet 5 fueron vulneradas con éxito (12,01%). En contraste, solo se comprometieron 4 de 5.901 solicitudes manejadas directamente por Sonnet 5.5.
Un estudio independiente de la empresa de seguridad Gray Swan no encontró impacto significativo en el rendimiento con fallback activado, pero las pruebas de Anthropic sugieren que los equipos deben considerar la seguridad del modelo anterior además de la del nuevo para evitar posibles brechas.
Experiencias previas con modelos como Fable 5 han mostrado la complejidad que genera este sistema. Poco después de su lanzamiento, un usuario que trabajaba en inteligencia de amenazas defendida notificó que la mayoría de mensajes en una sesión habían sido generados por el modelo anterior tras la activación del fallback, y que una vez cambiado el modelo no se volvía automáticamente al original.
Anthropic continúa ajustando sus clasificadores para reducir falsos positivos y planea ampliar un programa de verificación cibernética para ofrecer acceso con menos restricciones a usuarios certificados, aunque Sonnet 5.5 no estará disponible en ese programa desde su lanzamiento.