Liquid AI apresenta modelos dspark de rascunho para decodificação mais rápida sem comprometer a precisão da saída
A Liquid AI lançou modelos de rascunho para a sua série LFM2.5, incluindo LFM2.5-1.2B-Instruct, LFM2.5-2.6B e LFM2.5-8B-A1B. Estes modelos incorporam decodificação especulativa para melhorar significativamente o desempenho. Os rascunhos, cada um com cerca de 300 milhões de parâmetros, propõem um bloco de nove tokens candidatos, que o modelo alvo verifica numa única passagem direta. Esta abordagem resulta em velocidades de decodificação até 3,18 vezes mais rápidas numa GPU H100 e até 2,87 vezes mais rápidas num MacBook Pro M4 Max. A saída permanece inalterada, garantindo que a precisão do benchmark é preservada. Tanto o llama.cpp como o SGLang suportam os modelos, embora sejam necessários para atingir os modelos LFM2.5 uma construção com suporte DSpark.
O mecanismo de decodificação especulativa utiliza um modelo pequeno para gerar tokens que um modelo maior então valida. Os rascunhos são construídos com uma estrutura de cinco camadas de atenção completas, tamanho oculto de 2048, tamanho intermediário de 6144 e GQA em 32 cabeças sobre 8 cabeças KV. Os rascunhos não incluem pesos de vocabulário, com embeddings e cabeças LM ligados do modelo alvo no momento da carga. O repositório de rascunho de 2,6B é de 655 MB em BF16, representando o custo de memória real adicionado.
DSpark combina três componentes: uma estrutura paralela de estilo DFlash que produz estados ocultos para todos os tokens de rascunho numa única passagem direta, uma cabeça sequencial leve que restaura as dependências inter-tokens e um verificador agendado de confiança que prevê as probabilidades de sobrevivência dos tokens e elimina os sufixos de baixa confiança. A Liquid AI relata a taxa de transferência em 1xH100 em BF16 através do SGLang e num MacBook Pro M4 Max através do llama.cpp com pesos FP16 GGUF. Ambos utilizam um tamanho de bloco de 9, tamanho de lote de 1 e temperatura de 0 em vários benchmarks, incluindo MATH500, HumanEval, MBPP, GSM8K e MT-Bench.
A aceleração está intimamente ligada à taxa de aceitação, que reflete a previsibilidade da saída. Para LFM2.5-8B-A1B, o modelo aceita 8,27 de cada 10 tokens por passo no MATH500, mas apenas 4,02 no GSM8K, levando a uma diminuição da aceleração de 3,18x para 1,29x na mesma GPU. No modelo de 1,2B, a aceitação do MT-Bench desce para 3,90, reduzindo o ganho no H100 para 1,66x. No silício da Apple, o resultado MoE mostra uma limitação clara, com LFM2.5-8B-A1B a atingir apenas 1,18x de aceleração no M4 Max. A Liquid AI atribui isto à implementação atual de MoE no backend de Metal do llama.cpp e ao aumento do tráfego de peso ao verificar vários tokens.
O modelo de rascunho propõe um bloco de nove tokens após o ancore, e o modelo alvo verifica todos os dez numa única passagem direta. Os tokens correspondentes são mantidos, enquanto a primeira incompatibilidade é substituída pelo próprio token do alvo, com o rabo descartado. Ambos os caminhos emitem sequências gananciosas idênticas, com a reprodução a funcionar a uma velocidade de 1/20 para visualizar a lacuna. O rascunho não inclui pesos de vocabulário, com embeddings e cabeças LM ligados do modelo alvo no momento da carga.