Red Hat demuestra que un pequeño modelo de seguridad en IA casi iguala a uno de 35.000 millones de parámetros

Un clasificador ligero ejecutado en un portátil alcanzó una precisión similar a la de un enorme modelo de lenguaje de 35.000 millones de parámetros, con una latencia mucho menor, lo que podría revolucionar el diseño de barreras de seguridad para la inteligencia artificial.

En el panorama actual de la seguridad en inteligencia artificial, elegir qué tipo de barrera aplicar para evitar comportamientos riesgosos suele implicar optar entre un clasificador específico para la tarea o un gran modelo de lenguaje (LLM) que actúe como juez. Sin embargo, modelos basados en decisiones, como Jev de TypeSafe AI, han emergido como una tercera vía que promete flexibilidad sin los elevados costes de generación de texto.

Recientemente, el equipo de Inteligencia Artificial de Red Hat ha sometido a prueba estas tres opciones bajo las mismas condiciones, evaluando nueve configuraciones diferentes de sistemas de protección frente a ataques de «prompt injection» y cuestiones de seguridad en el contenido generado. Para ello, usaron el conjunto de herramientas open source NeMo Guardrails desarrollado por NVIDIA.

Los primeros resultados fueron sorprendentes. En la prueba de detección de inyección de comandos maliciosos en las solicitudes, el modelo Qwen3.6-35B —un LLM con 35.000 millones de parámetros— alcanzó un 89,31% de precisión, siendo la opción más eficaz. Sin embargo, el clasificador basado en DeBERTa de Red Hat, con apenas 200 millones de parámetros, se le acercó mucho con un 89,01%. Pese a la diferencia en el tamaño, la interpretación computacional (inferencia) mostró que esta brecha era menor de lo que aparenta.

Patrocinado

Donde sí hubo una gran diferencia fue en la latencia: el clasificador DeBERTa respondió en un tiempo medio de 54,1 milisegundos, mientras que Qwen3.6-35B necesitó 312,5 ms y Jev 348,1 ms. Esto significa que el modelo pequeño no solo ofreció un rendimiento casi idéntico en precisión, sino que tomó una fracción del tiempo comparado con los grandes LLM, una ventaja crítica para aplicaciones en tiempo real.

En las pruebas sobre seguridad de contenido, la situación cambió. Aquí Jev lideró con un 86,20% de precisión, seguido por DiffusionGemma —un modelo similar a Jev pero de código abierto— con un 85,53% y Qwen con un 85,47%. El clasificador Granite Guardian de Red Hat, con 125 millones de parámetros, ocupó el sexto lugar con un 80,27%, pero fue de nuevo el más rápido, con apenas 33,2 ms de latencia.

Red Hat planea integrar tanto el clasificador DeBERTa como Granite Guardian como configuraciones estándar de guardarraíles en su próxima versión OpenShift AI 3.6, consolidando su apuesta por modelos pequeños para ciertos riesgos definidos. Sin embargo, sus propios resultados reconocen que, en temas de contenido, aún es necesario mejorar los modelos predictivos compactos.

Ventajas de los modelos basados en decisiones

Los modelos de decisión, como Jev, funcionan tomando el estado de la aplicación y un conjunto de preguntas tipificadas para ofrecer respuestas igualmente tipadas y probabilísticas, lo que reduce la necesidad de generacion abierta de texto. Esta aproximación se traduce en una mayor eficacia para identificar una gama amplia de riesgos, desde prejuicios y violencia hasta actividades ilegales, contenidos explícitos o imitaciones de roles.

El análisis de Red Hat confirma que, en políticas complejas y amplias, los modelos de decisión y de tipo Jev superan a los clasificadores especializados para detectar contenido inapropiado con una diferencia de más de cinco puntos porcentuales. No obstante, Red Hat no recomienda sustituir por completo a los LLM jueces, ya que modelos como Nemotron 3.5 de NVIDIA, aunque ligeramente menos precisos, responden más rápido y pueden ser una mejor opción en ciertos escenarios.

Además, el ecosistema open source ofrece alternativas competitivas. DiffusionGemma igualó e incluso superó a Jev en algunas pruebas, y Laya, otro modelo abierto con 421 millones de parámetros, logró un 85,44% en detección de inyección de comandos ejecutándose en un portátil, aunque su exactitud en seguridad de contenido varió según la política aplicada.

La importancia del diseño y ajuste de las políticas

Red Hat evidenció que la calidad de los resultados depende mucho de las definiciones de riesgo o «prompts» utilizados para entrenar o dirigir los modelos. Cambiar las políticas de NVIDIA por otras diseñadas internamente incrementó el rendimiento de Nemotron en inyección de comandos del 69,37% al 84,84%. Laya experimentó variaciones desde un pobre 57,87% hasta un sólido 75,20% con distintas políticas, mientras que Jev descendió del 86,20% al 82,53% tras un ajuste de políticas.

Esto revela que una política ajustada que mejora mucho un modelo puede perjudicar a otro, complicando la comparación directa y mostrando que la elaboración adecuada de las reglas es tan crucial como el modelo mismo. Los responsables subrayan que muchas mejoras en guardarraíles se deben mayormente a un mejor «prompting» y no solo a la arquitectura del modelo.

La latencia y su dependencia del entorno de ejecución

Las diferencias en latencia no solo responden a la velocidad de cálculo, sino también al despliegue técnico. Mientras que los modelos más grandes se evaluaron en GPU en clusters AWS en Estados Unidos, los modelos pequeños corrieron localmente en un MacBook Pro con chip M1 en Reino Unido. La comunicación remota agregó un retraso estimado de al menos 56 ms por petición, lo que implica que los momentos de respuesta reales son aún más favorables para los clasificadores pequeños cuando se consideran tiempos netos.

Para aplicaciones que requieren respuestas inmediatas en la interacción con usuarios, estos detalles marcan la diferencia. Mantener los guardarraíles locales evita demoras adicionales, posibles fallos externos y reduce costes, lo que aboga por soluciones ligeras cuando la tarea lo permite.

¿Qué modelo elegir como guardarraíl?

El balance presentado por Red Hat es claro: para riesgos concretos y bien definidos con abundante entrenamiento, un clasificador pequeño es la mejor opción por su rapidez y precisión. Sin embargo, para políticas más amplias o ambiguas donde no existen modelos rígidos efectivos, un modelo de decisión o un LLM juez justifican su coste extra.

No obstante, la idea de que los modelos de decisión ya son el estándar para guardarraíles queda cuestionada. El modelo Jev demostró que no supera sistemáticamente ni a los clasificados grandes ni a los pequeños en todos los tests, indicando que todavía hay espacio para combinar enfoques según el caso.

Finalmente, destaca que las pruebas se realizaron solo en inglés, por lo que su validez en entornos multilingües aún está por determinarse.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado