Bottlecap AI lanza ThinkingCap-Qwen3.8-27B con un uso reducido de tokens
BottleCap AI ha presentado ThinkingCap-Qwen3.8-27B, una versión refinada del modelo Qwen3.8-27B, diseñada para minimizar el uso de tokens de razonamiento sin comprometer las capacidades centrales. El modelo logra una reducción del 37,2% en el uso promedio de tokens en 12 benchmarks, aunque la precisión promedio disminuye en 0,86 puntos porcentuales hasta el 85,79%. Disponible a través de vLLM o SGLang con FP8, NVFP4, GGUF y MLX, el modelo está disponible en un repositorio con acceso restringido, donde el uso comercial requiere un acuerdo con BottleCap.
El enfoque de la actualización se centró en reducir el uso innecesario de tokens al tiempo que se preservaba la capacidad de razonamiento, el seguimiento de instrucciones y la seguridad. Los benchmarks clave muestran resultados mixtos, con importantes recortes de tokens en tareas de conocimiento y multilingües, como MMMLU y MMLU-Pro. Sin embargo, el modelo mantiene el rendimiento en tareas de recuperación de contexto largo y agentes, con solo pequeñas disminuciones en la precisión. La principal compensación se observa en AIME 2026, donde la precisión disminuye en 3,85 puntos porcentuales para una reducción del 30,2% en los tokens. BottleCap recomienda utilizar la configuración xhigh de esfuerzo de razonamiento para un equilibrio óptimo entre precisión y uso de tokens.