lupAI
Tutoriais & Guias

Motor strata permite executar o modelo Qwen3.8 de 125b em GPU de 12gb com desempenho de 94 tokens por segundo

QwenFonte: ITHome06/10/2026, 13:04
Um novo motor, chamado Strata, foi lançado pelo desenvolvedor Niko1221, permitindo que o modelo Qwen3.8-Flash-Next de 125B parâmetros seja executado em GPUs de nível de consumidor com 12GB ou mais de VRAM. O modelo, desenvolvido pela equipe Qwen da Alibaba em agosto de 2026, é uma versão comprimida de um modelo MoE multimodal com 125B parâmetros e uma tabela de incorporação n-gram de 51B parâmetros. Suporta um comprimento de contexto de até 262K tokens. O Strata reduz o uso de memória carregando todo o modelo MoE na RAM e apenas os especialistas mais utilizados na VRAM. Também utiliza modelos leves para decodificação especulativa para acelerar a inferência. Em uma RTX 5070 com 12GB de VRAM, a versão quantizada de 2 bits do modelo alcança 94 tokens por segundo, enquanto a versão de 3 bits atinge 53 tokens por segundo. A AMD RX 9070 XT com 16GB de VRAM também mostra desempenho com a versão de 2 bits a 60 tokens por segundo.
Motor strata permite executar o modelo Qwen3.8 de 125b em GPU de 12gb com desempenho de 94 tokens por segundo — lupAI