Meta lanza Muse Glimmer, un modelo de 30B con pesos abiertos para flujos de trabajo de agentes locales
Meta ha lanzado Muse Glimmer, un modelo multimodal de 30 mil millones de parámetros destilado de Muse Spark y optimizado para flujos de trabajo de agentes siempre activos locales. El modelo combina un transformador causal denso con un codificador de percepción dedicado, con atención de consulta agrupada y un patrón de atención repetido para procesamiento eficiente. Comprimido a aproximadamente 4 bits de precisión con decodificación especulativa a nivel de bloque, Muse Glimmer se ejecuta en una única GPU de consumo o Mac sin requerir llamadas de red. El modelo admite hasta 131.072 tokens de contexto e incluye una torre de visión de 1.8B que acepta hasta 4.096 tokens visuales por imagen. Dos compilaciones cuantizadas están disponibles: K-Quant-Dynamic apunta a 32 GB VRAM con degradación promedio de 0.2%, mientras que K-Quant-17GB apunta a 24 GB VRAM con degradación de 1.0%. Los pesos se lanzan bajo Apache 2.0 con compatibilidad con pesos BF16, k-quants GGUF, compilaciones ExecuTorch y soporte de drafter DFlash disponibles en Hugging Face.