Claude Opus 5.5 frente a Opus 5: más barato y rápido, pero sin mejoras en razonamiento

Anthropic presenta Claude Opus 5.5, un modelo que promete reducir costes y acelerar la generación de respuestas en un 40% y 30%, respectivamente. Sin embargo, en pruebas de razonamiento complejo, Opus 5.5 ofrece el mismo nivel de rendimiento que Opus 5, con un ahorro significativo en tiempo y gasto, pero sin mejora en la calidad de las respuestas.

Anthropic ha lanzado recientemente Claude Opus 5.5, un modelo que según la compañía supone una mejora notable en eficiencia respecto a su predecesor, Opus 5. El nuevo modelo promete reducir los costes de uso en un 40% y generar resultados un 30% más rápido, situándose en el nivel de rendimiento de Claude Fable 5.1, que supera a Opus 5.

Para los desarrolladores, Anthropic ha reducido los precios a través de su API: Opus 5.5 cuesta 4 dólares por cada millón de tokens entrantes y 20 dólares por millón de tokens salientes, frente a los 5 y 25 dólares del modelo anterior. Esta rebaja de tarifas representa un ahorro inmediato del 20%, mientras que el resto del ahorro se basa en un uso más eficiente de los tokens.

Para evaluar cómo estos cambios afectan a los usuarios medios, se compararon Opus 5 y Opus 5.5 en tareas específicas de razonamiento, evitando los habituales escenarios de desarrollo. Estas tareas siguen siendo el punto débil habitual de estos modelos, por lo que constituyen la prueba de fuego para Opus 5.5.

Patrocinado

Metodología de las pruebas

Se usó la API de Anthropic para enviar a ambos modelos exactamente las mismas instrucciones, con el ajuste de ‘pensamiento adaptativo’ activado. Debido a que Opus 5.5 no permite desactivar esta función, la comparativa se mantuvo homogénea.

Los problemas evaluados fueron tres:

  • Rejilla lógica (dificultad media): Consiste en asignar a siete ingenieros un día de guardia, un lenguaje de programación, un servicio y una ciudad, usando 22 pistas con condiciones y exclusiones.
  • Ordenación con restricciones (dificultad alta): Se debe reorganizar una serie de trabajos de despliegue para que ninguno quede en el mismo lugar original, además de evitar que trabajos consecutivos se encuentren adyacentes. Se solicitó el conteo de secuencias válidas para conjuntos de 6, 8 y 10 trabajos.
  • Juego de piedras con memoria (dificultad muy alta): Dos jugadores quitan piedras con restricciones de movimientos que no pueden repetirse. Se requirió determinar el ganador partiendo de 200 piedras, contar las posiciones perdedoras entre 1 y 500 piedras, y encontrar la posición perdedora menor a 500 y mayor a 340.

Se registraron tokens usados de entrada y salida, coste, y tiempo empleado por cada modelo.

Resultados detallados

Rejilla lógica

Ambos modelos resolvieron correctamente las 28 casillas del problema en poco más de un minuto. Opus 5.5 completó la tarea en 65 segundos usando 7.573 tokens de salida, con un coste estimado de 0,16 dólares, frente a 108 segundos y 10.621 tokens de Opus 5, con costo de 0,27 dólares. Esto representa un 43% de ahorro y algo más de detalle en la respuesta por parte de Opus 5.5.

Ordenación con restricciones

Este fue el mayor reto para ambos modelos. Ni Opus 5 ni Opus 5.5 pudieron proporcionar una solución. La respuesta correcta para conjuntos de 6, 8 y 10 trabajos es extremadamente compleja y requiere ejecución de código para su cálculo.

Con un límite de salida de 48.000 tokens, ambos modelos agotaron el tiempo y la capacidad sin entregar resultados: Opus 5.5 tardó 489 segundos con un coste aproximado de 0,96 dólares, Opus 5 empleó 553 segundos y 1,20 dólares.

Al aumentar el límite a 128.000 tokens, Opus 5 alcanzó todo el límite en más de 25 minutos sin resultado, alcanzando 3,20 dólares, mientras que Opus 5.5 respondió después de 19 minutos con un rechazo por filtro de seguridad, probablemente erróneo ya que no había contenido sensible.

Juego de piedras

En esta tarea, ambos modelos respondieron correctamente las tres preguntas planteadas. Opus 5.5 tardó 215 segundos, generando 28.740 tokens y costando 0,58 dólares; Opus 5, en cambio, tardó 624 segundos con 74.981 tokens y un coste de 1,88 dólares. Esto supone un ahorro del 69% y una reducción del 62% en tokens usados para el mismo resultado.

Análisis global

En conjunto, Opus 5.5 fue un 11% más rápido en generación de tokens que Opus 5, aunque sin alcanzar el 30% anunciado por Anthropic. El ahorro en costes fue notable, especialmente en tareas donde los modelos terminaron con respuestas correctas. Sin embargo, en problemas complejos que requieren razonamiento profundo, ambos modelos quedaron igualados, sin avances en calidad.

Los datos resumidos en la tabla comparativa muestran que Opus 5.5 completó las tareas en menos tiempo (31 minutos 45 segundos frente a 46 minutos 49 segundos) y con un coste total estimado de 3,95 dólares frente a 6,55 dólares de Opus 5.

Reflexión final

Aunque Anthropic posiciona a Opus 5.5 como un claro avance frente a Opus 5 en diversos ámbitos, las pruebas de razonamiento indicaron un empate técnico, con beneficios en ahorro económico y de tiempo, pero sin avances en la capacidad de resolver problemas complejos.

Por tanto, el cambio a Opus 5.5 es recomendable para usuarios actuales de Opus 5, especialmente para tareas que combinen razonamiento con costes y tiempo, siempre prestando atención a los límites de tokens en problemas complejos para evitar gastos innecesarios.

Para desafíos específicos de conteo, como el problema de ordenación, es preferible emplear herramientas que permitan ejecución de código complementaria al modelo, pues la simple capacidad de razonamiento actual de los modelos no es suficiente para estos casos.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado