El nuevo modelo GPT-6 Astra de OpenAI cuesta 2,5 veces más por token, pero los desarrolladores siguen ahorrando

Aunque GPT-6 Astra de OpenAI tiene un coste por token significativamente superior al GPT-5.6 Sol, muchos desarrolladores logran reducir gastos usando configuraciones de razonamiento ajustadas que optimizan eficacia y costes.

OpenAI ha lanzado GPT-6 Astra, su modelo más reciente de inteligencia artificial, que plantea un dilema para desarrolladores que evaluaban actualizar desde el GPT-5.6 Sol: el precio por token en Astra es 2,5 veces mayor que en Sol. Sin embargo, OpenAI sostiene que esta inversión extra puede compensar, siempre y cuando se utilice el nivel adecuado de esfuerzo de razonamiento, incluso en configuraciones bajas.

Thibault Sottiaux, líder de ingeniería en Codex de OpenAI, compartió a través de la red social X que «GPT-6 Astra en modo bajo supera el rendimiento de GPT-5.6 Sol en modo alto». Este comentario se apoya en datos proporcionados por Artificial Analysis, que otorga a Astra en configuración baja una puntuación de 49 en su índice de inteligencia, frente a 48 que obtiene Sol en configuración alta. Además, Astra genera resultados notablemente más rápido: 2,53 segundos para el primer token, en comparación con 11,87 segundos del modelo anterior.

El coste del esfuerzo de razonamiento

A nivel tarifario, Astra cobra 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, mientras que Sol lo hace a 4 y 20 dólares respectivamente. Aunque ajustar el nivel de razonamiento entre alto y bajo no modifica el coste por token, influye en la cantidad de trabajo realizado para completar una tarea, lo que incide directamente en el coste final a pagar. OpenAI destaca que Astra puede producir resultados de mayor calidad generando menos tokens de salida, lo que reduce el coste total.

Patrocinado

OpenAI expone que, según su benchmark Terminal-Bench 4.0, Astra obtiene un 57,9% de aciertos frente al 37,3% de Sol, con un coste por tarea aproximadamente un 9% menor. En otro test, GPQA Diamond, Astra logra un 94,9% frente al 94,6% de Sol, con un gasto estimado un 37% inferior. Estas pruebas indican que fijarse exclusivamente en el coste por token no garantiza entender el gasto real que generará el modelo, motivo por el que OpenAI está explorando sistemas de tarificación basados en resultados.

Menos tokens, tareas más económicas

Desarrolladores como Shinpr han evaluado el comportamiento de distintos niveles de razonamiento de Astra contra Sol, usando un mismo código base. En su análisis, Astra en configuración media completó implementaciones en apenas 80 solicitudes, menos de un tercio de las 238 que necesitaba Sol en alto, y procesó 11,1 millones de tokens de entrada frente a 37,8 millones del modelo anterior. El tiempo total de ejecución fue de 51 minutos, por un coste aproximado de 25,67 dólares, mientras que Sol en alto tardó unos 75 minutos y costó 31,79 dólares.

Incrementar el nivel de razonamiento al máximo no resultó beneficioso para este desarrollador, ya que prolongó el tiempo a 77 minutos y elevó el coste a 37,23 dólares, además de no detectar un fallo inicial que sí fue captado con la configuración media. Aunque esta experiencia puntual no asegura que la configuración media sea óptima en todos los casos, sí evidencia que un mayor esfuerzo de razonamiento no siempre compensa.

Más razonamiento, facturas más bajas

Sin embargo, pruebas de ARC Prize muestran un escenario diferente donde un esfuerzo de razonamiento más alto no solo mejora la precisión sino que también reduce costes. En pruebas con su entorno estándar, Astra obtuvo un 17,5% en nivel bajo, 38,6% en medio, 54,8% en alto y un 62,7% en máximo rendimientos. Curiosamente, el coste más elevado se dio en el nivel medio, con unos 48.090 dólares, mientras que el nivel máximo solo costó 26.098 dólares.

Esto se explica porque a niveles máximos Astra utiliza mayor capacidad computacional en cada decisión, pero resuelve las tareas con menos acciones, reduciendo la cantidad de intentos posteriores necesarios. Así, aunque una configuración de bajo razonamiento pueda parecer barata, los errores resultantes suelen generar costos adicionales mayores que corregir desde el principio con un razonamiento superior.

Razonamiento dinámico sin perder contexto

Para evitar tener que elegir solo un nivel de razonamiento para todo el flujo, Astra introduce una función llamada configuration_update que permite variar el esfuerzo entre respuestas sin alterar la configuración inicial. Esto permite mantener un nivel bajo en tareas rutinarias y escalar a un mayor nivel ante problemas complejos o errores, para luego regresar a la configuración habitual.

Esta capacidad dinámica ayuda a comprender por qué Shinpr y ARC Prize obtuvieron resultados tan distintos: uno experimentó un aumento en coste y tiempo con más razonamiento sin mejorar resultados, mientras que otro logró ahorros gracias a un uso estratégico del esfuerzo.

Actualmente, esta función solo está disponible en solicitudes estándar con un único agente, pero subraya que no hay que alarmarse ante el mayor coste por token de Astra. Un modelo que parezca caro puede ser más económico si reduce el número de llamadas y repeticiones necesarias para completar una tarea con éxito.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado