Claude Fable 5.1 frente a Fable 5: La actualización no marca la diferencia en tareas reales

Anthropic presenta Claude Fable 5.1, una versión que, según los ensayos, duplica el rendimiento en benchmarks científicos, pero en pruebas de uso real no muestra mejoras relevantes frente a su antecesor.

Anthropic lanzó esta semana Claude Fable 5.1, cuyo equipo anuncia como su modelo más avanzado para programación y tareas relacionadas con el conocimiento. El lanzamiento despertó gran expectación en la comunidad tecnológica; Dan Shipper, CEO de una conocida startup, afirmó tras una semana de pruebas que se trata del modelo más potente para codificación que han utilizado hasta ahora. Paralelamente, el experto en inteligencia artificial Min Choi compartió diversos ejemplos de usuarios que, en las primeras 24 horas, lograron desarrollar juegos, crear entornos 3D y diseñar simulaciones complejas con el nuevo sistema.

Uno de los grandes atractivos del anuncio fue la mejora en el benchmark Terminal-Bench-Science, un test diseñado para medir la capacidad investigadora de un modelo a través de tareas científicas multidisciplinares. Según Anthropic, Claude Fable 5.1 consiguió una puntuación del 52,6% frente al 24,7% obtenido por Fable 5, lo que evidenciaría una marcada evolución en la capacidad para completar correctamente tareas complejas que requieren múltiples pasos.

Terminal-Bench-Science ofrece al modelo un entorno similar a una terminal y una serie de retos científicos para resolver. El porcentaje indica la proporción de tareas correctamente finalizadas. Esta diferencia es la principal métrica que justifica el salto de versión, máxime cuando el precio por millón de tokens no ha cambiado (10 dólares en entrada y 50 en salida).

Patrocinado

Sin embargo, estos resultados aún no garantizan mejoras en escenarios cotidianos.

Los benchmarks son útiles, pero no siempre reflejan con precisión el desempeño en aplicaciones reales. Las pruebas se circunscriben a conjuntos muy concretos de tareas y, a menudo, son optimizadas por los fabricantes para destacar en dichas evaluaciones. No se indica explícitamente que Anthropic haya incurrido en esta práctica, pero es un riesgo inherente al marketing asociado a benchmarks.

Ante estas dudas, decidí contrastar ambas versiones en escenarios prácticos replicando tareas habituales para usuarios de inteligencia artificial, que van más allá de las estrictas condiciones del test científico.

Pruebas realizadas

Para ello escogí cuatro tipos de trabajos que reflejan usos reales:

  • Investigación automatizada: manipular datos experimentales con errores distribuidos, guiándose por unas notas de laboratorio para filtrar información errónea, calcular promedios y resumir conclusiones.
  • Programación asistida: corregir un proyecto pequeño en Python que contiene dos errores ocultos y una batería de tests fallidos, hasta que todo pase correctamente.
  • Razonamiento matemático: resolver dos problemas con respuestas exactas previamente verificadas; este test no involucraba uso de terminal.
  • Auditoría de datos de sensores: analizar registros ruidosos de cinco sensores con problemas conocidos documentados, como un reloj que funciona rápido, cambios en hardware durante la captura, filas corruptas o datos en diferentes unidades de medida.

Debido a la naturaleza compleja y dependiente de archivos de datos de las pruebas, no fue posible compartir los prompts exactos, pues sin los datos específicos pierden sentido.

Resultados en investigación automatizada

Ambos modelos finalizan esta tarea con éxito en tres interacciones. Identificaron correctamente las cinco filas defectuosas, incluyendo el caso especialmente sutil de un duplicado con una entrada errónea y otra válida. Calcularon los promedios perfectamente coincidentes con los valores reales, con una diferencia de tiempo mínima a favor de Fable 5.1 (19,2 frente a 20,6 segundos) y un coste algo inferior también para la versión nueva.

Durante este experimento, el modelo previo supuestamente fallaba en tres cuartas partes de los casos según su benchmark, pero aquí mostró rendimiento impecable.

Pruebas en codificación automatizada

En el test de programación, ambos detectaron y corrigieron un error destacado, donde una función ‘remove’ sumaba en lugar de restar, así como el fallo más discreto por un índice fuera de rango. Las correcciones permitieron que las ocho pruebas pasaran con éxito en tres interacciones. Fable 5.1 fue algo más rápido (13,6 frente a 17,2 segundos), pero no hubo diferencias en precisión ni coste.

Resolución de problemas matemáticos

En el razonamiento abstracto, ambos modelos solventaron ambos problemas con corrección, exhibiendo el paso a paso adecuado. Fable 5.1 aportó ligeramente más rapidez (en torno a medio segundo menos) y mayor concisión, utilizando entre un 20 y un 30% menos de tokens en las respuestas.

Auditoría compleja de datos de sensores

Esta prueba adicional sirvió como desempate tras las respuestas idénticas en las tareas anteriores. Aquí se evaluaban decisiones específicas como ajustar correctamente el reloj acelerado, dividir los datos durante el cambio de sensor, descartar filas corruptas y convertir unidades tras la calibración. Ambas versiones resolvieron exitosamente todos los retos con resultados idénticos y precisos.

Sin embargo, Fable 5 fue más eficiente: completó la tarea en cuatro interacciones, gastando menos de 24 segundos y con un coste de 13 centavos de dólar. Fable 5.1, en cambio, requirió cinco interacciones, tardó cerca de 28 segundos y costó más del doble, unos 30 centavos. El sobrecoste se debió a que se enviaron más del triple de tokens en la conversación.

En la prueba más exigente, la versión anterior fue igual de precisa, pero más rápida y económica, algo inesperado para un modelo que prometía mejoras significativas.

Comparativa global y análisis final

Métrica Fable 5 Fable 5.1
Precisión 24/24 24/24
Total tokens usados 22.219 37.809
Coste total 0,398 USD 0,533 USD
Tiempo total 84,9 segundos 82,9 segundos

Ambos modelos lograron la máxima puntuación en todas las pruebas. Fable 5.1 terminó la batería apenas un par de segundos antes, pero consumió un 70% más de tokens y aumentó el coste un 34%. Hay que tener en cuenta que estas pruebas no incorporaron caching, lo que podría modificar esos datos de coste en escenarios reales.

Esto no significa que la mejora en benchmarks sea falsa, simplemente refleja que las condiciones del test son distintas de usos habituales para la mayoría de usuarios, que suelen enfrentar tareas de menor duración y distintas características.

En resumen, buscando una mejora significativa, encontré un modelo prácticamente indistinguible del anterior en tareas prácticas del día a día, como corrección de código, limpieza y análisis de datos con incidencias documentadas. En tareas largas y complejas, la actualización podría incluso resultar más costosa.

Buscaba un avance doble y hallé un modelo cuya diferencia con el anterior no pude identificar.

Por ello, si tus actividades se asemejan a estas pruebas, actualizar a Fable 5.1 no cambiará tus resultados centrales, salvo que trabajes con escenarios largos y particularmente complejos parecidos al benchmark, donde sí podrían verse mejoras según Anthropic. Sin embargo, estas pruebas requieren mucho tiempo y recursos para replicarlas y no resultan representativas para la mayoría de casos prácticos.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado