Nuevos Desarrollos

Liquid AI presenta modelos dspark de borrador para una decodificación más rápida sin comprometer la precisión de la salida

Liquid AIFuente: MarkTechPost20/08/2026, 23:47
Liquid AI ha lanzado modelos de borrador para su serie LFM2.5, incluidos LFM2.5-1.2B-Instruct, LFM2.5-2.6B y LFM2.5-8B-A1B. Estos modelos incorporan una decodificación especulativa para mejorar significativamente el rendimiento. Los borradores, cada uno con alrededor de 300 millones de parámetros, proponen un bloque de nueve tokens candidatos, que el modelo objetivo verifica en una sola pasada hacia adelante. Este enfoque resulta en velocidades de decodificación hasta 3,18 veces más rápidas en una GPU H100 y hasta 2,87 veces más rápidas en un MacBook Pro M4 Max. La salida permanece sin cambios, lo que garantiza la preservación de la precisión de las pruebas. Tanto llama.cpp como SGLang admiten los modelos, aunque requieren una compilación con soporte para DSpark para los objetivos LFM2.5. El mecanismo de decodificación especulativa utiliza un modelo pequeño para generar tokens que luego un modelo más grande valida. Los borradores están construidos con una estructura de cinco capas de atención completa, un tamaño oculto de 2048, un tamaño intermedio de 6144 y GQA en 32 cabezas sobre 8 cabezas KV. Los borradores no incluyen pesos de vocabulario, con incrustaciones y cabezales de LM vinculados del modelo objetivo en el momento de la carga. El repositorio del borrador de 2,6B es de 655 MB en BF16, lo que representa el costo de memoria real añadido. DSpark combina tres componentes: un marco paralelo de estilo DFlash que produce estados ocultos para todos los tokens de borrador en una sola pasada hacia adelante, una cabeza secuencial ligera que restaura las dependencias inter-tokens y un verificador programado de confianza que predice las probabilidades de supervivencia de los tokens y elimina los sufijos de baja confianza. Liquid AI informa sobre un rendimiento de 1xH100 en BF16 a través de SGLang y en un MacBook Pro M4 Max a través de llama.cpp con pesos GGUF de FP16 y Metal. Ambos utilizan un tamaño de bloque de 9, un tamaño de lote de 1 y una temperatura de 0 en múltiples pruebas, incluidas MATH500, HumanEval, MBPP, GSM8K y MT-Bench. La aceleración está estrechamente relacionada con la tasa de aceptación, que refleja la predictibilidad de la salida. Para LFM2.5-8B-A1B, el modelo acepta 8,27 de cada 10 tokens por paso en MATH500, pero solo 4,02 en GSM8K, lo que resulta en una caída de la aceleración de 3,18x a 1,29x en la misma GPU. En el modelo de 1,2B, la aceptación de MT-Bench cae a 3,90, reduciendo la ganancia en la H100 a 1,66x. En Apple silicon, el resultado MoE muestra una clara limitación, con LFM2.5-8B-A1B logrando solo un aumento de velocidad de 1,18x en el M4 Max. Liquid AI atribuye esto a la implementación actual de MoE en el backend de Metal de llama.cpp y al aumento del tráfico de peso al verificar múltiples tokens. El borrador propone un bloque de nueve tokens después del ancla, y el modelo objetivo verifica todos los diez en una sola pasada hacia adelante. Los tokens coincidentes se conservan, mientras que la primera discrepancia se reemplaza por el token del objetivo, descartando la cola. Ambos carriles emiten secuencias codiciosas idénticas, con la reproducción que se ejecuta a 1/20 de velocidad para visualizar la brecha. El borrador no incluye pesos de vocabulario, con incrustaciones y cabezales de LM vinculados del modelo objetivo en el momento de la carga.
Liquid AI presenta modelos dspark de borrador para una decodificación más rápida sin comprometer la precisión de la salida — lupAI