Nuevos Desarrollos

Thinking Machines Lab Presenta Inkling-Small: Modelo MoE de 276B Parámetros Ejecutable en GPU Única

Inkling-Small + Thinking Machines LabFuente: MarkTechPost02/08/2026, 17:35
La Thinking Machines Lab ha lanzado Inkling-Small, un modelo Mixture-of-Experts de pesos abiertos con 276 mil millones de parámetros totales y 12 mil millones activos, aproximadamente una cuarta parte del tamaño de Inkling. Entrenado en sistemas NVIDIA GB300 NVL72, el modelo razona nativamente sobre texto, imágenes y audio con una ventana de contexto de 1 millón de tokens, distribuido bajo Apache 2.0. La ventaja crítica es la accesibilidad computacional. El checkpoint en BF16 requiere un mínimo de 600GB de VRAM agregada, alcanzable con 4 GPUs B300 u 8 H200. Las versiones cuantizadas reducen significativamente este límite: el checkpoint NVFP4 funciona en 180GB, permitiendo inferencia en GPU única B300 con W4A4. Esto abre un modelo de 276 mil millones de parámetros a startups que alquilan instancias en cloud y empresas medianas con capacidad H200 existente. En benchmarks de razonamiento y programación, Inkling-Small supera su modelo profesor: 31.6% en Humanity's Last Exam versus 29.7% de Inkling, y 80.2% en SWE-bench Verified versus 77.6%. El modelo es sin codificador y nativo multimodal, procesando imágenes como patches de 40×40 píxeles y audio como espectrogramas dMel.
Thinking Machines Lab Presenta Inkling-Small: Modelo MoE de 276B Parámetros Ejecutable en GPU Única — lupAI