Anthropic presenta Claude Sonnet 5.5: rendimiento cercano a Opus a la mitad de coste

Anthropic lanza Claude Sonnet 5.5, un modelo que mejora en velocidad y eficiencia a su predecesor, acercándose al rendimiento de Opus 5.5 pero con un coste significativamente menor, consolidándose como la opción más rápida y económica para tareas cotidianas y de programación.

Anthropic ha anunciado este lunes el lanzamiento de Claude Sonnet 5.5, la última versión de su modelo principal y el segundo integrante de la familia Claude 5.5, después de Opus 5.5, presentado la semana pasada.

Además, la compañía tiene previsto lanzar una actualización de Claude Haiku, el modelo más pequeño y accesible de la línea, en las próximas semanas.

Una mejora del 30% en velocidad y reducción similar en costes

Claude Sonnet 5.5 genera resultados un 30% más rápido que su predecesor, Sonnet 5, y disminuye el coste por tarea hasta en un 30%, convirtiéndolo en el modelo Sonnet más veloz desarrollado por Anthropic hasta la fecha. La empresa destaca que esta versión ofrece una alternativa más rápida y económica que complementa a Opus 5.5.

Patrocinado

Según Anthropic, Sonnet 5.5 está especialmente optimizado para tareas cotidianas bien definidas, como solucionar errores y elaborar documentos, presentaciones y hojas de cálculo pulidas. Los primeros usuarios han notado que el modelo también mejora las interfaces de usuario y puede adaptar presentaciones a plantillas con mínimas correcciones.

Al igual que Opus 5.5, Sonnet 5.5 produce textos más claros y naturales que las generaciones anteriores de modelos desarrollados por la compañía, compartiendo esa mejora en la fluidez y claridad del lenguaje.

Rendimiento equiparable a Opus en la mayoría de pruebas

En cuanto a capacidades de programación, Sonnet 5.5 presenta los avances más significativos. En pruebas Terminal-Bench 4.0 —que evalúan tareas en línea de comandos— alcanza un 70,6% de acierto, frente al 10,3% de Sonnet 5 y el 66,4% de Opus 5.5. La baja puntuación anterior se explica en parte por problemas de tiempos límite y tokenización del modelo previo.

En CursorBench, que evalúa tareas reales de programación, Sonnet 5.5 queda a dos puntos de Opus 5.5, mientras que en FrontierCode, que mide si un cambio de código puede integrarse sin correcciones humanas, Sonnet 5.5 consigue un 52,1% en su segundo nivel de esfuerzo más alto, comparado con 54,4% de Opus 5.5 y 49,3% de GPT-6 Sol, de OpenAI.

Benchmarks Claude Sonnet 5.5
Resultados comparativos de Claude Sonnet 5.5. Crédito: Anthropic.

En tareas de gestión del conocimiento, Sonnet 5.5 obtiene 1.844 puntos en GDPval-AA de Artificial Analysis, que valora el desempeño en trabajos reales de 44 profesiones, situándose solo dos puntos por detrás de Opus 5.5 y superando en casi 400 puntos a Sonnet 5 y a GPT-6 Sol, que alcanza 1.487.

Asimismo, el modelo se acerca a Opus 5.5 en pruebas de uso informático y en Humanity’s Last Exam. Anthropic asegura que es el primer Sonnet capaz de superar el desafío de completar “Pokémon Red” trabajando únicamente con capturas de pantalla, una prueba no oficial que simula comprensión y trabajo a largo plazo.

En varias pruebas, Sonnet 5.5 logra superar los mejores resultados de Sonnet 5 con un esfuerzo medio o bajo y por solo una décima parte del coste por tarea.

No obstante, Opus 5.5 sigue siendo claramente superior en trabajos complejos y abiertos que requieren un juicio sostenido y continuo.

Precios y disponibilidad

Mientras que Anthropic redujo los precios de Opus 5.5 a 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida, y OpenAI al mismo tiempo rebajó los de sus modelos GPT-6 Sol y Luna, el coste de Sonnet 5.5 permanece fijo: 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida, además de 0,20 dólares por millón de tokens en lecturas de caché.

Este precio es equivalente al de GPT-6 Sol de OpenAI, catalogado como el segundo mejor modelo tras Astra.

Sin embargo, dado que Sonnet 5.5 utiliza significativamente menos tokens según las propias métricas de la empresa, los costes de operación deberían ser inferiores que con Sonnet 5.

Sonnet 5.5 ya está disponible en la plataforma Claude, además de en Amazon Web Services, Google Cloud y Microsoft Azure. Los desarrolladores que emplean Sonnet con la función de pensamiento desactivada deberán adaptarse a un nuevo parámetro (between_tools) antes de utilizar la nueva versión, ya que Opus 5.5 ya rechaza solicitudes sin activación del pensamiento.

Mecanismos de seguridad y ciberseguridad

Anthropic indica que Sonnet 5.5 mantiene capacidades de ciberseguridad similares a Opus 5, e incorpora por primera vez las salvaguardas habituales que se emplean en sus modelos más avanzados.

Las tareas rutinarias de corrección de errores no se ven afectadas, pero las solicitudes con alto riesgo de seguridad se remitirán a Sonnet 5. Además, Sonnet 5.5 es el primero en integrar clasificadores diseñados para impedir que actores malintencionados extraigan su razonamiento para entrenar modelos propios.

Este avance subraya el compromiso de Anthropic por ofrecer modelos robustos, eficientes y con protecciones avanzadas para usos tanto cotidianos como críticos.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado