Novos Desenvolvimentos

Apresentando Gemma 4 12B: um modelo multimodal unificado sem codificador

Google DeepMindFonte: Google DeepMind Blog09/06/2026, 11:10
O Gemma 4 12B é projetado para trazer inteligência multimodal de alto desempenho diretamente para seu laptop, combinando eficiência voltada para dispositivos móveis com raciocínio avançado. Diretor de Gestão de Produtos, Google Deepmind Seu navegador não suporta o elemento de áudio. Hoje, estamos apresentando o Gemma 4 12B, nosso mais recente modelo projetado para trazer inteligência multimodal agentica diretamente para laptops. Preenchendo a lacuna entre nosso E4B amigável para edge e nosso mais avançado Mixture of Experts (MoE) de 26B, o Gemma 4 12B empacota capacidades poderosas dentro de um consumo de memória reduzido. É também o nosso primeiro modelo de tamanho médio a apresentar entradas de áudio nativas. Graças à comunidade de desenvolvedores, os modelos Gemma 4 já ultrapassaram 150 milhões de downloads. Vocês construíram desde braços robóticos vestíveis para assistência física até segurança de IA de nível empresarial. Estamos ansiosos para ver o que vocês constroem com esta mais recente adição. Aqui está uma visão geral do que torna o Gemma 4 12B único: Em conjunto, estas características trazem capacidades multimodais avançadas para hardware cotidiano sem sacrificar velocidade ou raciocínio. Vamos agora analisar mais de perto como o Gemma 4 12B alcança isso. O Gemma 4 12B oferece desempenho próximo ao de nosso modelo MoE 26B maior em benchmarks padrão, mas com menos da metade do total de consumo de memória. Pequeno o suficiente para executar localmente em laptops de consumo com 16GB de RAM, desbloqueia experiências multimodais e agenticas poderosas bem em sua máquina. O que torna o Gemma 4 12B destaque é sua abordagem simplificada para processar entradas visuais e de áudio. Os modelos multimodais tradicionais geralmente dependem de codificadores separados para traduzir imagens e áudio antes de passar essas representações para o modelo de linguagem. Como esses codificadores divididos adicionam latência e aumentam o uso de memória, treinamos o Gemma 4 12B com uma arquitetura sem codificador para integrar entradas de áudio e visão diretamente. Aqui está como o Gemma 4 12B processa entradas multimodais nativamente: Para desenvolvedores que desejam um detalhamento, acesse nosso Guia do Desenvolvedor Gemma 4 12B que o acompanha.
Apresentando Gemma 4 12B: um modelo multimodal unificado sem codificador — lupAI