El lanzamiento de Strands Decider 2B por parte de Amazon Web Services (AWS) ha marcado un hito en la evolución de los modelos de decisión dentro de la inteligencia artificial, llegando con un detalle significativo: responde a través del mismo endpoint /v1/systemone que había estrenado la startup TypeSafe AI con su modelo Jev apenas dos semanas antes.
Lo que en principio parecía un experimento aislado se ha convertido rápidamente en una categoría con múltiples actores y servicios, entre ellos OpenAI, Upstage, Perplexity y Cloudflare, que también ofrecen modelos de decisión alojados; mientras que AWS y desarrolladores independientes han publicado pesos abiertos en plataformas como Hugging Face.
El elemento que se está estandarizando con mayor rapidez es el esquema de TypeSafe, que define la estructura de las solicitudes y respuestas en este tipo de modelos. Esta estandarización se da incluso cuando los proveedores usan sus propias URLs y endpoints, pero mantienen la compatibilidad con el formato de System One.
¿Qué devuelve un modelo de decisión?
Un modelo de decisión toma como entrada el estado de una aplicación, por ejemplo un mensaje de un cliente junto a las políticas aplicables, y un conjunto de preguntas tipadas. La salida es una respuesta estructurada con probabilidades asociadas a cada opción, sin generar textos explicativos, código o razonamientos. Así define TypeSafe a Jev como un modelo System One, haciendo referencia a la rapidez y intuición en la toma decisiones conceptualizada por el psicólogo Daniel Kahneman.
Este API reduce a tres los tipos de preguntas: las de elección simple que seleccionan una opción de una lista, las de puntuación que valoran la entrada en una escala ordenada, y las binarias (sí/no) que devuelven la probabilidad de que se cumpla una condición.
Además de las respuestas, el modelo ofrece un valor de confianza, que no debe entenderse como la probabilidad directa de que la respuesta sea correcta, sino como una medida de concentración en la distribución de probabilidades. Por ello, los desarrolladores deben calibrar estos valores según datos propios para establecer umbrales operativos adecuados.
En esencia, un modelo de decisión actúa como un condicional if dentro de una aplicación de IA: mientras que un modelo de lenguaje grande (LLM) puede clasificar un texto generando tokens y reportando una certeza imprecisa, el modelo de decisión devuelve una probabilidad con la que se puede decidir una rama en el flujo de ejecución de forma rápida y eficiente.
Tres patrones clave para la utilidad de Jev en agentes inteligentes
Los modelos de decisión no sustituyen a los LLM, sino que complementan su trabajo. Los LLM planifican, redactan y llaman a herramientas, mientras los modelos de decisión se encargan de las múltiples pequeñas valoraciones que surgen entre esos pasos.
Por ejemplo, en un agente de atención al cliente procesando una solicitud de reembolso, el LLM redacta la respuesta en lenguaje natural, mientras que una única llamada al modelo de decisión puede seleccionar la cola adecuada, evaluar el nivel de frustración del cliente y calcular si aplica la política de reembolso.
Desde el lanzamiento de Jev, han surgido tres patrones destacados:
- Enrutamiento eficiente: OpenRouter lanzó Jev Router, que selecciona el modelo y el nivel de razonamiento para cada solicitud, reservando el uso de modelos LLM costosos solo a las peticiones que realmente lo necesiten.
- Control en el uso de herramientas: En el ejemplo del repositorio Strands Decider, se determina mediante decisiones binarias si activar funciones específicas, como llamar a un servicio meteorológico solo cuando la información necesaria está clara, mejorando la precisión y evitando suposiciones.
- Mecanismos de respaldo: El gateway Bifrost de Maxim AI ofrece una ruta alterna enviando la decisión a un LLM cuando Jev no está disponible, simulando sus respuestas y manteniendo la coherencia en el formato.
Difusión del estándar System One
Los primeros en adoptar el esquema System One implementaron directamente el endpoint de TypeSafe. Por ejemplo, Upstage ofrece Solar Decide compatible con este esquema, Ollama ha añadido soporte nativo en su API y otros proyectos y comunidades han replicado el formato, creando un ecosistema interoperable.
Otros proveedores mantienen la semántica pero modifican la dirección URL, ofreciendo compatibilidad con clientes mediante rutas alternativas. Este es el caso de OpenRouter o Venice, mientras que Perplexity usa una API con funcionalidades similares pero distinta ruta.
Por ahora, OpenAI permanece como excepción, proponiendo su propia API de decisiones basada en GPT-6 Luna, en fase limitada y sin un esquema público ni un modelo de precios claro.
Esta dinámica permite una portabilidad a nivel de código, donde aplicaciones diseñadas para System One pueden cambiar de proveedor simplemente modificando la URL base, sin alterar la lógica interna de decisiones. Pero persisten diferencias en capacidad, calidad y confianza, lo que exige pruebas cuidadosas.
Lecciones del precedente en APIs de LLM
La evolución del API Chat Completions de OpenAI ofrece un paralelo instructivo. Este se convirtió en el estándar de facto al ser replicado por múltiples proveedores, incluso antes de que OpenAI lanzara su especificación abierta Open Responses, con apoyo de la comunidad y diversos socios.
La experiencia indica que los formatos se consolidan inicialmente por uso y compatibilidad más que por gobernanza formal, como ocurre ahora con System One. También subraya que, para evitar fragmentación, la empresa que define el esquema debe abrirlo. Si OpenAI persiste con un formato propio, la categoría podría fragmentarse en dos estándares rivales.
Modelos alojados, pesos abiertos e híbridos
Los servicios alojados cobran por el uso mediante token, mientras que los modelos con pesos abiertos se ejecutan en infraestructuras propias, manteniendo la privacidad y control de los datos. Jev es la implementación de referencia alojada, aunque su tamaño y base no se han divulgado.
Upstage ha desarrollado Solar Decide sobre un modelo MoE de 35 mil millones de parámetros, mientras que Perplexity ha lanzado su modelo pplx-decider con pesos Apache 2.0 y combina infraestructuras propias y alojadas, mejorando sus métricas de decisión.
Muchas implementaciones abiertas usan Qwen3.5 como base, con algunos proyectos avanzando hacia Qwen3.8 y otros modelos como ModernBERT. Algunos evitan la decodificación autoregresiva para optimizar el rendimiento y tiempos de respuesta.
Evaluación y fiabilidad
Los modelos de decisión actúan directamente sobre sus respuestas, lo que hace crítica su robustez. Investigadores han demostrado que un atacante puede alterar hasta el 61.4% de decisiones correctas introduciendo contextos diseñados, evidenciando vulnerabilidades inherentes al enfoque general, no a un proveedor concreto.
Esto requiere que los equipos establezcan varias capas de control y no confíen exclusivamente en los valores de confianza para garantizar la seguridad y precisión.
Economía y ventajas de un contrato compartido
El coste de un modelo como Jev ronda los 0.042 dólares por millón de tokens de entrada en plataformas como OpenRouter, mientras que la oferta de Perplexity resulta más económica. Esto hace que la toma de decisiones sea considerablemente más barata que una llamada completa a un LLM.
Para las empresas, un contrato estándar permite aprobar una única integración que puede cambiarse por otro proveedor según necesidades de precisión, precio o privacidad, mejorando su capacidad de negociación y evitando ataduras a un solo proveedor.
Para los proveedores, la existencia de un estándar apretado desplaza la competencia hacia la calidad del modelo y su calibración, dado que los clientes pueden cambiar fácilmente de backend con solo modificar una URL.
Perspectivas futuras
System One se posiciona actualmente como el principal estándar para modelos de decisión gracias a su adopción por AWS, Upstage, Ollama y la comunidad de código abierto. La decisión de OpenAI respecto a publicar o no su propio esquema será determinante para la consolidación del mercado.
Estos modelos están emergiendo como una capa de juicio portátil y económica que acompaña a los LLM. La confianza en su uso para decisiones críticas dependerá menos de la convergencia del API que de la mejora continua en calibración, robustez y de los mecanismos de seguridad aplicados por los desarrolladores.