El mejor agente de IA para programar falla en más del 60% de los casos, según nuevo benchmark

Claude Fable 5.1 lidera una prueba de codificación basada en código privado real, pero logra solo un 38,8% de aciertos, revelando las limitaciones actuales de la inteligencia artificial ante entornos desconocidos.

Claude Fable 5.1 se ha impuesto en un nuevo benchmark de codificación, pero con un porcentaje de éxito del 38,8%, lo que significa que falla más de seis veces de cada diez intentos. Este resultado proviene de Real-SWE, una prueba desarrollada por Specific Labs, respaldada por Y Combinator, que plantea un enfoque distinto para evaluar agentes de codificación.

En lugar de asignar problemas basados en repositorios públicos ya conocidos, Real-SWE sitúa a los agentes en bases de código privadas y reales de empresas, enfrentándolos a retos que reflejan las tareas que los ingenieros afrontan a diario. Estas bases no están disponibles públicamente, lo que reduce significativamente la posibilidad de que forman parte del conjunto de datos utilizado para entrenar a los modelos.

Specific Labs reconoce que no puede garantizar al cien por cien que los agentes nunca hayan visto fragmentos de este código, pero estima que el 99% de las cadenas de texto (token) que surgen en contextos empresariales reales permanecen ocultas para los modelos punteros actuales. Al introducir a los agentes en terrenos desconocidos, sus puntuaciones cayeron drásticamente.

Patrocinado

Código privado, un desafío real

El ranking liderado por Fable 5.1, que funciona mediante Claude Code, alcanzó el 38,8%. Le siguieron GPT-6 Astra con Codex CLI, que logró un 33,8%, y Gemini 3.8 Flash con Gemini CLI, con un 31,2%. A partir de ahí, la puntuación bajó con rapidez: GLM 5.3 obtuvo un 28,8%, Grok 4.6 y Muse Spark 1.3 empataron a 23,8%, Kimi K3 quedó en 18,8% y GPT-5.6 Sol cerró con un 16,2%.

Cada modelo dispuso de ocho intentos para resolver cada tarea. Además, los ensayos se hicieron utilizando las herramientas propias asociadas a cada agente, por lo que los resultados reflejan el rendimiento total del conjunto y no solo del modelo de IA.

Como evidenció anteriormente el desempeño de GPT-6 Astra en otros benchmarks, cambiar el entorno o las herramientas que rodean a un modelo puede modificar su rendimiento notablemente. Por ejemplo, Fable 5.1 podría obtener resultados diferentes si se ejecuta con Cursor en lugar de Claude Code.

Seis tareas resultaron insondables para todos los modelos

Real-SWE utiliza código licenciado privadamente de negocios reales, como un producto de consumo con más de 200.000 usuarios y una plataforma fintech responsable de procesar más de 100.000 extractos bancarios. Las soluciones abarcan distintas áreas del código, tocando en promedio 11 archivos por problema, casi el doble del promedio en benchmarks más comunes como FrontierCode o DeepSWE.

Los resultados por tarea revelan que seis de las diez presentaban tasas de éxito inferiores al 15%. Por ejemplo, una tarea relacionada con la migración de un sistema de facturación solo contó con un 14,1% de aciertos, la gestión de tokens de API alcanzó un 12,5%, el seguimiento de almacenamiento en S3 apenas superó el 10,9% y un escaneo linealizable solo se resolvió correctamente el 4,7% de las veces. Una incidencia sobre la jurisdicción fiscal se arregló en solo el 3,1% de las ocasiones.

Ningún modelo consiguió solucionar la tarea de reducción de streams analíticos tras 64 intentos. Astra y Gemini lograron completar correctamente ocho de ocho intentos en una limpieza multi-región, mientras que Fable acertó siete de ocho, sin embargo, todos ellos fallaron en todas las pruebas del escaneo linealizable. Ningún agente resultó consistentemente fiable en todo el benchmark.

Errores comunes y dificultades encontradas

En el caso de Fable 5.1, la mayoría de fallos se debieron a no cumplir con los requerimientos (36,7%) o a errores de integración (34,7%). Astra repartió sus errores casi equitativamente entre fallos de integración y supuestos no verificados, ambos con un 34%. En Gemini 3.8 Flash, casi la mitad de los fallos fueron errores de integración, mientras que GPT-5.6 Sol incurrió en supuestos no confirmados en el 43,3% de sus errores.

El significado real del 38,8% de éxito

Aunque Real-SWE no demuestra de forma concluyente que los benchmarks públicos de codificación estén sobrevalorados por contaminación de datos, y pese a que examina un número todavía limitado de tareas, el dato de que el mejor agente de IA falle más del 60% en escenarios reales y con código privado sugiere que el reto de programar en un entorno desconocido en producción difiere mucho de resolver problemas estándar bien documentados.

Esta prueba pone de manifiesto las grandes limitaciones que aún enfrentan los agentes de inteligencia artificial al intentar replicar el trabajo de programación real, especialmente cuando deben lidiar con grandes bases de código desconocidas y criterios de integración complejos, alejados de supuestos académicos o repositorios públicos.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado