Liquid AI presenta el modelo dspark draft para modelos de visión-lenguaje, mejorando la velocidad de decodificación hasta en 3,13 veces
Liquid AI ha lanzado LFM2.5-VL-3B-DSpark, un modelo experimental de decodificación especulativa para su modelo de visión-lenguaje, LFM2.5-VL-3B. El modelo añade aproximadamente 280 millones de parámetros y acelera la decodificación sin alterar la salida del modelo. Logra una decodificación hasta 3,13 veces más rápida en Apple silicon y 2,66 veces en una NVIDIA H100. El modelo está disponible en Hugging Face en los formatos Safetensors y GGUF, con soporte en SGLang, MLX-VLM y llama.cpp. Liquid AI etiqueta el lanzamiento como experimental, bajo la licencia LFM Open v1.0, lo que permite un uso comercial gratuito para empresas con ingresos anuales inferiores a 10 millones de dólares.
DSpark, basado en los modelos de texto DSpark de Liquid AI, lee los estados ocultos de múltiples capas y predice los siguientes k tokens. El drafter opera de forma independiente de la modalidad, tratando los textos y los fragmentos de imagen como tensores. Utiliza un modelo de atención simplificado con 4 capas y un tamaño de bloque de 9, recomendado para la inferencia. Los datos de entrenamiento cubrieron tareas comunes de visión-lenguaje durante 10 épocas, realizadas exclusivamente en hardware AMD. La evaluación en el benchmark MMSpec mostró un rendimiento en seis tipos de tareas, con resultados que variaron según la tarea y el hardware.