Los agentes de inteligencia artificial consumen una cantidad desproporcionada de recursos computacionales generando texto que, en muchos casos, no es necesario. En procesos donde se deben tomar decisiones simples, como elegir entre opciones predefinidas, muchos agentes siguen utilizando modelos generativos, incurriendo en un coste elevado en tokens y tiempo a la espera de una respuesta escrita para después interpretarla. Esta sobrecarga ha generado preocupación en la industria; por ejemplo, investigadores de OpenAI han reportado gastos diarios de hasta 7.000 dólares solo en la ejecución de cargas de trabajo de agentes.
En este contexto, Jared Palmer ha lanzado Kev, una serie de modelos abiertos de decisión basados en la arquitectura Qwen 3.5, que evitan por completo el paso de generación textual. La nueva generación de Kev se compone de modelos con 0,8 mil millones, 4 mil millones y 9 mil millones de parámetros, todos ellos prefill-only, es decir, procesan el estado, las preguntas y las posibles respuestas en una única pasada directa, y determinan la decisión a través de un «puntero» sin necesidad de ejecutar un bucle autoregresivo de decodificación.
Decisiones sin texto generado
Kev está diseñado para tres tipos de decisiones: Noul para respuestas binarias (sí/no), Choice para seleccionar entre varias opciones, y Score para establecer un ranking o niveles ordenados. Los desarrolladores entregan el contexto y las preguntas al modelo, y el puntero devuelve probabilidades para cada opción proporcionada. Por ejemplo, en una decisión de enrutamiento de herramientas, la salida podría ser:
search: 0.82database: 0.13calculator: 0.05
Si bien Kev todavía puede seleccionar una opción incorrecta, una gran ventaja es que solo evalúa y puntúa las opciones que le son dadas, evitando inventar alternativas no contempladas en la lista.
Este enfoque permite que tareas como enrutamiento, comprobaciones de seguridad, escalado y clasificación se gestionen en esta capa de decisión eficiente, mientras que modelos de mayor capacidad se encargan de razonamientos abiertos y generación de respuestas complejas para el usuario final.
Decisiones múltiples en una sola ejecución
Kev puede procesar varias decisiones simultáneamente sobre un mismo estado con una única pasada, gracias a una atención en bloque causal que aísla las preguntas mientras el puntero puntúa independientemente cada conjunto de candidatos. En pruebas, el modelo de 4.000 millones de parámetros procesó tres preguntas en apenas 277 milisegundos utilizando bf16 en un GPU M5.
Este método cobra especial relevancia a medida que los ciclos de interacción en agentes se vuelven más complejos, donde la capacidad de evaluar múltiples decisiones de forma rápida y paralela puede mejorar la eficiencia global, aunque es importante destacar que omitir la generación de texto no implica necesariamente que las decisiones resultantes sean más precisas o acertadas.
Limitaciones y calibración
El mayor de los modelos, Kev-9B, alcanzó un 83,7 % de precisión en tests de dominio cerrado fuera del conjunto de entrenamiento, aunque estos datos son autofacilitados por el desarrollador y vienen acompañados de advertencias sobre ciertas limitaciones. Por ejemplo, aunque Kev devuelve probabilidades para sus elecciones, estas no siempre reflejan de forma fiable el nivel real de confianza. Palmer constató que la calibración puede fallar ante distribuciones de datos no vistas previamente: incluso una elección de alta probabilidad puede ser incorrecta.
Además, el proceso de ajuste fino del modelo afecta algunas habilidades del modelo base, evidenciándose en un descenso en pruebas de conocimiento general y aritmética, especialmente en las versiones con menos parámetros. Esto es coherente con el papel más especializado que Kev asume junto a modelos generales, pero su eficacia en entornos dinámicos dependerá también de cómo gestione herramientas, alternativas y etiquetas nunca vistas en su entrenamiento. Adicionalmente, muchas incidencias en agentes suelen deberse más a la infraestructura que al modelo en sí.
Inspiración y competencia
Kev no es la primera aproximación a esta técnica. Poco antes, TypeSafe presentó Jev como parte de la plataforma System One, utilizando las mismas primitivas de decisión (Noul, Choice y Score). Kev incluso soporta el formato de petición y respuesta /v1/systemone para permitir a las aplicaciones creadas para esa API dirigir las solicitudes a un servidor local de Kev.
>
Una diferencia clave radica en que Kev se ha lanzado bajo licencia Apache 2.0, con pesos del modelo, código de entrenamiento y herramientas de evaluación disponibles públicamente, lo que permite a los desarrolladores ejecutar y entrenar Kev en su propia infraestructura. Por contra, Jev no ofrece weights ni datos abiertos, dificultando comparaciones directas de rendimiento.
Impacto en aplicaciones y futuro
Para aplicaciones que necesitan tomar solo unas pocas decisiones limitadas, utilizar decodificación controlada en un modelo ya operativo puede resultar más sencillo que añadir un modelo extra. Sin embargo, en contextos donde los agentes repiten constantes ciclos de decisión —entre enrutado, clasificación, chequeos de seguridad, selección de herramientas y escalado— antes de generar texto para el usuario, esta nueva categoría de modelos como Kev representa una oportunidad para eliminar cálculos innecesarios y mejorar la eficiencia.
En definitiva, cuando las etapas intermedias requieren únicamente una elección o probabilidad, Kev puede encargarse de la toma de decisión directamente, cediendo el razonamiento abierto y la generación de respuestas complejas a modelos generativos más potentes y costosos.