Nuevos Desarrollos

Presentando Gemma 4 12B: un modelo multimodal unificado sin codificador

Google DeepMindFuente: Google DeepMind Blog09/06/2026, 11:10
Gemma 4 12B está diseñado para traer inteligencia multimodal de alto rendimiento directamente a tu portátil, combinando eficiencia orientada a dispositivos móviles con razonamiento avanzado. Director de Gestión de Productos, Google Deepmind Tu navegador no soporta el elemento de audio. Hoy, estamos presentando Gemma 4 12B, nuestro modelo más reciente diseñado para traer inteligencia multimodal agentica directamente a portátiles. Cerrando la brecha entre nuestro E4B amigable para edge y nuestro modelo Mixture of Experts (MoE) de 26B más avanzado, Gemma 4 12B empaqueta capacidades poderosas dentro de una huella de memoria reducida. También es nuestro primer modelo de tamaño medio en presentar entradas de audio nativas. Gracias a la comunidad de desarrolladores, los modelos Gemma 4 ahora han cruzado 150 millones de descargas. Han construido desde brazos robóticos portátiles para asistencia física hasta seguridad de IA de nivel empresarial. Estamos emocionados de ver lo que construyen con esta última adición. Aquí hay una descripción general de lo que hace único a Gemma 4 12B: Juntas, estas características traen capacidades multimodales avanzadas al hardware cotidiano sin sacrificar velocidad o razonamiento. Ahora veamos más de cerca cómo lo logra Gemma 4 12B. Gemma 4 12B ofrece un rendimiento cercano al de nuestro modelo MoE de 26B más grande en puntos de referencia estándar, pero con menos de la mitad del consumo total de memoria. Lo suficientemente pequeño para ejecutarse localmente en portátiles de consumo con 16GB de RAM, desbloquea experiencias multimodales y agenticas poderosas directamente en tu máquina. Lo que destaca a Gemma 4 12B es su enfoque simplificado para procesar entradas visuales y de audio. Los modelos multimodales tradicionales típicamente dependen de codificadores separados para traducir imágenes y audio antes de pasar esas representaciones al modelo de lenguaje. Debido a que estos codificadores divididos agregan latencia e incrementan el uso de memoria, entrenamos Gemma 4 12B con una arquitectura sin codificador para integrar entradas de audio y visión directamente. Así es como Gemma 4 12B procesa entradas multimodales nativamente: Para desarrolladores que desean un desglose, diríganse a nuestra Guía del Desarrollador de Gemma 4 12B que los acompaña.
Presentando Gemma 4 12B: un modelo multimodal unificado sin codificador — lupAI