Actualización v0.32.6
Se ha publicado una actualización de la versión 0.32.6 de un modelo de lenguaje. Esta versión incluye mejoras en el rendimiento en GPUs de Apple y cambios en la forma en que se procesan las respuestas.
Entre los cambios destacados se encuentran la mejora en la velocidad del MLX en GPUs de Apple, gracias a la utilización del modelo MTP para decodificación especulativa. Además, se ha actualizado el formato de streaming de completions para que coincida con el formato de OpenAI. Las respuestas truncadas de OpenAI ahora reportan la razón de finalización como "length" en lugar de "tool_calls".
“Las respuestas truncadas de OpenAI ahora reportan la razón de finalización como "length" en lugar de "tool_calls"”
La versión 0.32.6 también incluye mejoras en la interfaz de usuario, como la corrección de problemas con la renderización de texto y la mejora en la respuesta a la entrada del usuario. Sin embargo, se ha retirado temporalmente la generación de imágenes experimentales, por lo que los usuarios que necesitan esta función deben seguir utilizando la versión 0.32.5.
La actualización se ha publicado en GitHub, donde se puede encontrar el registro completo de cambios. La versión 0.32.6 es una versión prelanzamiento, y se ha publicado con el fin de probar y mejorar la estabilidad del modelo antes de su lanzamiento oficial. Los desarrolladores han actualizado los motores MLX y llama.cpp, y se han realizado varias mejoras y correcciones de errores.