Google DeepMind lança embeddinggemma 2, um modelo de incorporação multimodal de código aberto para aplicações locais
A Google DeepMind lançou o EmbeddingGemma 2, um modelo de incorporação multimodal de código aberto com 740 milhões de parâmetros, projetado para aplicações de pesquisa, classificação e RAG (Retrieval-Augmented Generation) focadas na privacidade, que funcionam localmente. O modelo, construído sobre a arquitetura Gemma 4, suporta texto, código, imagens, vídeo e áudio, incorporando-os em um espaço de 768 dimensões. Possui uma janela de contexto de 8K tokens e está disponível sob uma licença Apache 2.0. Os pesos estão disponíveis no Hugging Face e no Kaggle, com versões Oll, llama.cpp e LiteRT disponíveis.
O EmbeddingGemma 2 oferece configurações modulares, permitindo que os desenvolvedores escolham entre 270 milhões, 440 milhões, 570 milhões ou os 740 milhões de parâmetros completos. O modelo alcança resultados de ponta nos benchmarks MTEB Code e MAEB, com resultados de precisão total em 768 dimensões. A quantização reduz o uso de memória, com pesos apenas para texto exigindo cerca de 191 MB em um Pixel 11 Pro. O modelo também suporta o Aprendizado de Representação Matryoshka, permitindo a redução de dimensões para eficiência de armazenamento.
O modelo funciona em vários frameworks, incluindo sentence-transformers, Transformers, vLLM e MediaPipe. É compatível com Qdrant para armazenamento de vetores e Unsloth para ajuste fino. A Google DeepMind também anunciou o suporte futuro do ML Kit para Android com aceleração NPU.