🔎
Más
Especiales
Filtros
IA hace 1 h

Introducir difusión de inferencia 4-bit en Nunchaku

Introducir difusión de inferencia 4-bit en Nunchaku

La integración de la difusión de inferencia de 4 bits en Nunchaku permite a los modelos de texto a imagen funcionar con menos recursos. Esto se logra a través de la cuantización, una técnica que reduce la precisión de los pesos y las activaciones en los modelos de aprendizaje automático.

Algunos hechos clave sobre esta integración son: * La cuantización reduce la memoria necesaria para cargar los modelos de texto a imagen. * La difusión de inferencia de 4 bits en Nunchaku se logra a través del método SVDQuant. * SVDQuant maneja las grandes diferencias en los pesos y las activaciones de los modelos de difusión. * La integración de Nunchaku en Diffusers permite cargar modelos cuantizados sin necesidad de compilación local. * Los modelos cuantizados pueden funcionar en tarjetas gráficas NVIDIA Blackwell.

“Los modelos cuantizados pueden funcionar en tarjetas gráficas NVIDIA Blackwell, lo que los hace más accesibles para los desarrolladores que no tienen acceso a hardware de alta gama”

La cuantización es una técnica que reduce la precisión de los pesos y las activaciones en los modelos de aprendizaje automático. Esto se hace para reducir la memoria necesaria para cargar los modelos y mejorar su rendimiento. Sin embargo, la cuantización estándar puede ser difícil de implementar en los modelos de difusión debido a las grandes diferencias en los pesos y las activaciones. El método SVDQuant maneja este problema al mover las diferencias en las activaciones a los pesos y representar la parte más difícil de cada matriz de pesos con una rama de 16 bits de baja rango.

La integración de Nunchaku en Diffusers permite a los desarrolladores cargar modelos cuantizados sin necesidad de compilación local. Esto se logra a través de la función `from_pretrained()` de Diffusers, que puede cargar modelos cuantizados directamente desde la biblioteca. Los modelos cuantizados pueden funcionar en tarjetas gráficas NVIDIA Blackwell, lo que los hace más accesibles para los desarrolladores que no tienen acceso a hardware de alta gama.

En resumen, la integración de la difusión de inferencia de 4 bits en Nunchaku es una técnica que permite a los modelos de texto a imagen funcionar con menos recursos. La cuantización es una técnica clave en esta integración, y el método SVDQuant maneja las grandes diferencias en los pesos y las activaciones de los modelos de difusión. La integración de Nunchaku en Diffusers permite a los desarrolladores cargar modelos cuantizados sin necesidad de compilación local, lo que los hace más accesibles para una amplia gama de aplicaciones.