Claude Sonnet 5.5 vs Opus 5.5: un 42% más económico y perfecto en todas las pruebas

Anthropic ha lanzado Sonnet 5.5, que destaca por su precisión perfecta en todos los tests y un coste un 42% inferior al de Opus 5.5, pese a necesitar más tokens en algunas tareas. Analizamos ambas IA en pruebas técnicas para determinar cuál ofrece mejor rendimiento y eficiencia.

Seis días después de la presentación de Opus 5.5, la compañía Anthropic lanzó su nuevo modelo Sonnet 5.5. Según sus datos, Sonnet 5.5 alcanza una puntuación del 70,6% en la prueba Terminal-Bench 4.0, superando el 66,4% logrado por Opus 5.5 bajo el mismo nivel de esfuerzo elevado (xhigh effort). Además, Sonnet 5.5 genera resultados con una velocidad superior a un 30% comparado con Sonnet 5 y emplea menos tokens por tarea, lo que influye directamente en los costes de uso.

En cuanto a precios, Sonnet 5.5 cobra 2 dólares por cada millón de tokens de entrada y 10 dólares por cada millón de tokens de salida, la mitad que Opus 5.5, que cuesta 4 y 20 dólares respectivamente. Sin embargo, un coste por token más bajo no implica automáticamente pagar menos por tarea. Al aumentar la cantidad de tokens necesarios para completar los trabajos, las economías pueden reducirse considerablemente.

Un análisis independiente realizado por Artificial Analysis confirmó que, con esfuerzo máximo, Sonnet 5.5 resultaba más caro que Opus 5.5: 7,67 dólares frente a 5,98 dólares por tarea. Por mi parte, mis pruebas previas sugerían que Opus 5.5 era el modelo económico por excelencia, pero la llegada de Sonnet 5.5 me impulsó a reevaluar estas conclusiones.

Patrocinado

En el pasado, Sonnet no terminó de convencerme. A pesar de tener un precio inferior a Opus 5, solía preferir el modelo Opus por una calidad de salida superior. Por ello, decidí compararlos a fondo con el objetivo de verificar si Sonnet 5.5 merecía la pena y podría sustituir a Opus 5.5.

Metodología de prueba

Ambos modelos fueron evaluados mediante la API de Anthropic, aplicando las mismas instrucciones, configuración de pensamiento adaptativo y máximo esfuerzo. Cada prueba se repitió cinco veces por modelo para garantizar la consistencia. Analicé la cantidad de tokens usados, coste según tarifas oficiales y tiempo de ejecución, además de evaluar cada resultado con un conjunto oculto de tests que los modelos no conocían previamente.

  • Corrección de bugs en agente Python: Se proporcionó un repositorio pequeño con cuatro errores implantados y un test inestable. El modelo debía corregirlos sin alterar los archivos de pruebas. Un paquete oculto de 12 tests verificó las soluciones, y se registraron las llamadas a herramientas auxiliares pues se indicaba que Sonnet 5.5 las requeriría menos.
  • Especificación de resolver dependencias: Sin poder ejecutar código, los modelos debían implementar un resolvedor de dependencias según la especificación de un gestor ficticio de paquetes. Se utilizaron 120 tests ocultos para calificar.
  • Corrección de bugs de concurrencia: Se entregó una cola de trabajos en asyncio con tres condiciones de carrera y un informe de incidentes que destacaba cargos dobles y tareas no ejecutadas. Debían corregirlos sin código en ejecución y pasar ocho tests ocultos.

Corrección de bugs en agente Python

Ambos modelos corrigieron los cuatro errores en las cinco ejecuciones y superaron las 12 pruebas ocultas sin modificar los test problemáticos, identificando también el test inestable. Sonnet 5.5 tardó de media 5 minutos y 8 segundos, hizo 29 llamadas a herramientas, generó 42.608 tokens y costó 0,70 dólares por ejecución. Opus 5.5 fue más rápido, con 3 minutos y 21 segundos, 25 llamadas a herramientas, 20.625 tokens y 0,75 dólares.

Sonnet 5.5 usó casi el doble de tokens que Opus 5.5, lo que redujo sustancialmente el beneficio de su menor tarifa por token. Durante la primera prueba, Sonnet 5.5 llegó al límite máximo de 32.000 tokens por paso en 4 de 5 ejecuciones, provocando que estas se cortasen prematuramente. Al elevar el límite a 128.000 tokens, las pruebas se completaron con éxito. Estos fallos supusieron un coste adicional aproximado de 1,40 dólares por ejecución, aumentando el coste medio a 0,98 dólares, aún superior a los 0,75 dólares de Opus.

Por ello, Opus 5.5 ganó esta prueba, al ser un 35% más rápido y tener un coste menor cuando se consideran incluso los intentos fallidos de Sonnet.

Especificación del resolvedor

Sonnet 5.5 ganó claramente en esta prueba. Ambos modelos aprobaron los 120 tests, pero Sonnet fue más rápido y barato. Su media fue de 8 minutos y 58 segundos, 81.097 tokens y 0,82 dólares por ejecución, frente a 9 minutos y 40 segundos, 70.687 tokens y 1,42 dólares para Opus 5.5. Aunque Sonnet empleó un 15% más tokens, su coste se redujo en un 42% y terminó un poco antes.

Bugs de concurrencia

Este fue el test más sorprendente. Sonnet 5.5 corrigió los tres fallos y superó las ocho pruebas ocultas en todas las cinco ejecuciones. Opus 5.5 lo logró solo en tres, ya que en dos ocasiones alcanzó el máximo de 128.000 tokens sin generar resultados.

En promedio, Sonnet tardó 12 minutos y 13 segundos, creó 101.788 tokens y costó 1,02 dólares; Opus tardó 16 minutos y 43 segundos, generó 111.428 tokens y costó 2,24 dólares, incluyendo los fallos. Sonnet se impuso con claridad, siendo perfecto en cada prueba, más rápido y por menos de la mitad de coste.

Resultados globales

Prueba (5 ejecuciones) Sonnet 5.5 Opus 5.5
Corrección agente 5/5 perfecto, 5:08, 42.608 tokens, 29 llamadas, 0,70 $ 5/5 perfecto, 3:21, 20.625 tokens, 25 llamadas, 0,75 $
Resolvedor dependencia 5/5 perfecto, 8:58, 81.097 tokens, 0,82 $ 5/5 perfecto, 9:40, 70.687 tokens, 1,42 $
Bugs concurrencia 5/5 perfecto, 12:13, 101.788 tokens, 1,02 $ 3/5 perfecto, 16:43, 111.428 tokens, 2,24 $
Ejecuciones perfectas 15 de 15 13 de 15
Tiempo total (15 ejecuciones) 2 h 11 m 36 s 2 h 28 m 39 s
Coste total (15 ejecuciones) 12,69 $ 22,07 $

En resumen, Sonnet 5.5 completó todas las pruebas con éxito y a un coste un 42% inferior al de Opus 5.5, que falló dos veces en el test de concurrencia. Si se contabilizan los intentos fallidos de Sonnet, el ahorro sigue siendo un 36%. Además, Sonnet fue un 11% más rápido en el cómputo global. Mientras Sonnet dominó las pruebas de resolver dependencias y concurrencia, Opus venció en la corrección agente con una mayor rapidez y menor coste, si se descuentan los errores de Sonnet.

Reflexiones finales

Mientras que el análisis de Artificial Analysis apuntaba a un coste mayor para Sonnet 5.5 en tareas de máximo esfuerzo junto a una puntuación ligeramente inferior, mis pruebas indicaron lo contrario: Sonnet fue más preciso y económico, incluso considerando los ajustes necesarios en el límite de tokens.

Por tanto, un coste por token reducido no garantiza pagar la mitad, pues Sonnet requiere más tokens en ciertas tareas; aun así, resulta un 36% más barato que Opus 5.5 en promedio.

Recomiendo usar Sonnet 5.5 como opción predeterminada para cargas de trabajo complejas que exijan codificación, siempre configurando un límite alto de tokens por paso para evitar interrupciones. Para bucles de agentes, sin embargo, sigue siendo preferible Opus 5.5, que es más rápido y económico cuando no se requiere tanto procesamiento en un solo paso.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado