Intel reduce la compresión de modelos de lenguaje ternarios por debajo del límite teórico sin alterar pesos

Un equipo de Intel ha desarrollado un nuevo formato de compresión llamado BITCOS que logra almacenar modelos ternarios con un tamaño de 1,485 bits por peso, superando el límite teórico de 1,58 bits, sin modificar los pesos del modelo ni su rendimiento.

Intel ha anunciado un avance en la compresión de modelos de lenguaje basados en pesos ternarios (-1, 0 y +1). Tradicionalmente, el límite teórico para el almacenamiento de estos modelos es 1,58 bits por peso, un valor que supone una distribución uniforme entre los tres posibles valores. Sin embargo, los investigadores de Intel han logrado reducir este tamaño hasta 1,485 bits por peso con su innovador formato BITCOS, sin necesidad de alterar ni reentrenar el modelo, simplemente modificando la forma en que se almacenan los pesos.

El nuevo formato, documentado en el artículo BITCOS, mejora notablemente la compresión al separar la información de cero y la de signo para los pesos no nulos. Este enfoque aprovecha la alta proporción de ceros presentes en modelos ternarios reales, que puede variar entre el 29,7% y el 51,5% según el análisis de 29 checkpoints de siete familias diferentes de modelos ternarios realizado por Intel.

Origen del límite de 1,58 bits y su superación práctica

El cálculo de 1,58 bits como mínimo surge al considerar que cada peso tiene tres posibles valores equiprobables. Sin embargo, en la práctica, la distribución real está desequilibrada y contiene un porcentaje significativo de ceros. Además, el método convencional de almacenamiento empaqueta cinco pesos ternarios en un byte de 8 bits, lo que se traduce en un promedio de 1,6 bits por peso, y en algunos casos llega a 1,625 bits por peso debido a bytes parcialmente sin usar.

Patrocinado

Intel detectó que al explotar la alta prevalencia de ceros en los modelos, su formato BITCOS puede almacenar los pesos de manera más eficiente. En el caso más extremo que estudiaron, un modelo ternario Qwen3-1.7B cuantizado con CAT-Q tenía un 51,48% de ceros, lo que permitió reducir el tamaño hasta 1,485 bits por peso.

Funcionamiento del formato BITCOS

El nombre BITCOS deriva de “BITmap and COmpacted Signs”. El formato divide los pesos en dos flujos separados: uno que indica mediante un bit por peso si éste es cero o no, y otro que almacena el signo de cada peso no nulo. Así, un peso positivo o negativo ocupa dos bits (uno para la presencia y otro para el signo), mientras que un cero sólo requiere un bit para indicar su presencia, ya que no necesita un bit de signo.

Matemáticamente, si «z» representa la proporción de ceros, la cantidad de bits por peso en BITCOS es 2 – z. Por ejemplo, con un 40% de ceros se alcanzan 1,6 bits por peso y con un 51,5% se llega a 1,485 bits. Por lo tanto, el sistema logra superar el umbral teórico habitual al aprovechar la estructura real de los modelos sin comprometer su precisión.

Beneficios de rendimiento y aplicabilidad

La compresión avanzada no solo reduce el espacio de almacenamiento, sino que también incrementa el rendimiento de descodificación. BITCOS fue diseñado para descodificación token a token con pequeños tamaños de lote, lo que reduce la cantidad de datos que transitan por la memoria.

Intel desarrolló kernels de desempaquetado optimizados para procesadores AVX-512 y AVX2, así como para sus GPUs Xe2. En particular, aprovechan instrucciones especiales como pdep en CPUs AVX-512 para dispersar los bits de signo de manera eficiente. En GPUs Xe2, donde esa instrucción no está disponible, se implementó una solución con una tabla de consulta de 2KB.

Los test realizados en cinco sistemas diferentes mostraron mejoras de rendimiento significativas en comparación con kernels fijos de 2 bits. En un servidor Xeon de 64 núcleos, la mejora fue del 10% al 18%; en el procesador Core Ultra 9 de 24 núcleos, del 2% al 15%; y en GPUs integradas y discretas Arc de Intel, se alcanzaron incrementos de hasta un 27%. Estas pruebas se llevaron a cabo tras la carga completa del modelo y enfocan la optimización en la decodificación, complementando otras iniciativas para reducir el tiempo de inicio en inferencia GPU.

Limitaciones y perspectivas futuras

No obstante, el nuevo formato no es universalmente superior. En la CPU Lunar Lake de 8 núcleos, el kernel fijo de 2 bits fue más rápido que BITCOS en todos los modelos estudiados, dado que en ese hardware el cuello de botella era la descompresión y no el ancho de banda. En GPUs, BITCOS mantuvo su ventaja, aunque los beneficios se vieron limitados por el coste del descodificado.

Además, el estudio hasta ahora solo incluye benchmarks en hardware Intel y sobre siete modelos con lotes de tamaño uno. El impacto en arquitecturas de terceros como Nvidia, AMD o Arm sigue sin evaluarse.

En definitiva, BITCOS representa un salto relevante en la compresión eficiente de modelos de lenguaje ternarios, ofreciendo mayor compactación y rendimiento sin modificar el modelo original. Sin embargo, los resultados abiertos sugieren que la elección óptima de formato dependerá del tipo de hardware y la tarea específica de inferencia.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado