Comprimir modelos sin pérdida: GLM-5.2 en un 25% menos de memoria
Investigadores han encontrado una forma de comprimir modelos de lenguaje sin pérdida de datos. El modelo GLM-5.2 puede ser comprimido en un 25% menos de memoria.
La compresión se logra mediante dos métodos diferentes: el accounting K15 y la representación byte-split. El accounting K15 reduce el tamaño del modelo en un 30,17% al reemplazar los símbolos de signo y exponente de 9 bits con códigos de 4 bits. La representación byte-split reduce el tamaño en un 24,97% al dividir los pesos en dos partes y comprimir cada una por separado.
“El accounting K15 reduce el tamaño del modelo en un 30,17% al reemplazar los símbolos de signo y exponente de 9 bits con códigos de 4 bits”
La investigación también encontró que la mayoría de los pesos en un modelo entrenado tienen exponentes repetitivos, lo que permite una compresión más eficiente. Los resultados de la compresión se han verificado mediante un script que verifica la reconstrucción bit a bit de los tensores del modelo.
La compresión de modelos de lenguaje es importante porque permite reducir el tamaño de los modelos y mejorar su eficiencia en términos de memoria y velocidad de procesamiento. Esto es especialmente útil para aplicaciones que requieren modelos de lenguaje grandes y complejos, como la traducción automática y la generación de texto.
El trabajo de investigación se basa en la idea de que los exponentes de los pesos en un modelo entrenado son repetitivos y pueden ser comprimidos de manera eficiente. La investigación también se inspira en trabajos anteriores, como ZipNN y DFloat11, que han demostrado la viabilidad de la compresión de exponentes en modelos de lenguaje. Sin embargo, el enfoque utilizado en esta investigación es diferente y no reclama la novedad de la idea de compresión de exponentes, sino que se centra en la implementación y verificación de la compresión en un modelo de lenguaje grande y complejo como GLM-5.2.