Novos Desenvolvimentos

Thinking Machines Lab lança Inkling-Small, modelo MoE multimodal com 276B parâmetros executável em GPU única

Inkling-Small + Thinking Machines LabFonte: MarkTechPost02/08/2026, 17:35
A Thinking Machines Lab divulgou Inkling-Small, um modelo aberto Mixture-of-Experts com 276 mil milhões de parâmetros totais e 12 mil milhões ativos, aproximadamente um quarto do tamanho do Inkling original. Treinado em sistemas NVIDIA GB300 NVL72, o modelo raciocina nativamente sobre texto, imagens e áudio com janela de contexto de 1 milhão de tokens, sob licença Apache 2.0. O ponto crítico está na acessibilidade computacional. O checkpoint BF16 requer pelo menos 600GB de VRAM agregada, atingível com 4 GPUs B300 ou 8 H200. Versões quantizadas reduzem substancialmente este limite: o checkpoint NVFP4 funciona com 180GB, permitindo que uma única GPU B300 execute o modelo em W4A4. Isto torna um modelo de 276 mil milhões parâmetros acessível a startups que alugam instâncias em cloud e empresas médias com infraestrutura H200 existente. Em benchmarks de raciocínio e programação, Inkling-Small supera seu modelo professor: 31.6% em Humanity's Last Exam contra 29.7% do Inkling, e 80.2% em SWE-bench Verified contra 77.6%. O modelo é codificador-livre e multimodal nativo, processando imagens como patches de 40×40 pixels e áudio como espectrogramas dMel.
Thinking Machines Lab lança Inkling-Small, modelo MoE multimodal com 276B parâmetros executável em GPU única — lupAI