lupAI
tutoriais

El motor strata permite ejecutar el modelo Qwen3.8 de 125b en una GPU de 12 gb con un rendimiento de 94 tokens por segundo

QwenFuente: ITHome06/10/2026, 13:04
Un nuevo motor llamado Strata ha sido lanzado por el desarrollador Niko1221, lo que permite ejecutar el modelo Qwen3.8 de 125B parámetros en GPU de gama de consumo con 12 GB o más de VRAM. El modelo, desarrollado por el equipo Qwen de Alibaba en agosto de 2026, es una versión comprimida de un modelo MoE multimodal con 125B parámetros y una tabla de incrustación n-grama con 51B parámetros. Soporta una longitud de contexto de hasta 262K tokens. Strata reduce el uso de memoria cargando todo el modelo MoE en la RAM y solo los expertos utilizados con frecuencia en la VRAM. También utiliza modelos ligeros para la decodificación especulativa para acelerar la inferencia. En una RTX 5070 con 12 GB de VRAM, la versión cuantificada de 2 bits del modelo alcanza 94 tokens por segundo, mientras que la versión de 3 bits alcanza 53 tokens por segundo. La AMD RX 9070 XT con 16 GB de VRAM también muestra un rendimiento con la versión de 2 bits a 60 tokens por segundo.
El motor strata permite ejecutar el modelo Qwen3.8 de 125b en una GPU de 12 gb con un rendimiento de 94 tokens por segundo — lupAI