Google presenta DiffusionGemma, un modelo que genera texto 4 veces más rápido
Google lanzó DiffusionGemma, un modelo experimental de código abierto con 26 mil millones de parámetros basado en arquitectura de Mezcla de Expertos. A diferencia de los modelos de lenguaje tradicionales que procesan texto secuencialmente token a token, DiffusionGemma genera bloques completos de texto de forma simultánea, logrando velocidades hasta cuatro veces superiores en procesadores gráficos dedicados.
El modelo utiliza difusión como tecnología para optimizar inferencia local en escenarios de bajo concurrencia. Mientras que en entornos de nube los servidores distribuyen tareas entre múltiples solicitudes, en computadoras personales una GPU permanece frecuentemente inactiva durante la generación secuencial de palabras. DiffusionGemma resuelve esta ineficiencia procesando 256 tokens en paralelo, transformando la inferencia de una operación secuencial en procesamiento paralelo de alto rendimiento.
La arquitectura está diseñada para desarrolladores que crean aplicaciones interactivas en tiempo real, incluyendo edición inline, prototipado rápido y generación de estructuras de texto no-lineales. El ajuste fino permite adaptación a tareas especializadas, como se demostró en la resolución de acertijos Sudoku, un desafío donde los modelos autoregresivos enfrentan dificultades por dependencias de tokens futuros. Bajo licencia Apache 2.0, DiffusionGemma avanza la investigación en procesamiento de lenguaje natural basado en difusión, aunque los modelos autoregresivos de la familia Gemma siguen siendo el estándar para aplicaciones de producción que requieren máxima fidelidad de salida.