NVIDIA Presenta Molt: Framework de RL Agentic en PyTorch con Solo 8.6K Líneas de Código
El equipo NeMo de NVIDIA ha presentado Molt, un framework nativo de PyTorch para reinforcement learning agentic construido sobre una premisa inusual: el código debe ser lo suficientemente pequeño para que un investigador pueda comprenderlo completamente y para que un asistente de IA pueda razonar sobre él de manera integral. Molt contiene solo 8.6 mil líneas de código RL, sustancialmente menor que alternativas como verl (62K líneas) u OpenRLHF (7.2K líneas).
El framework compone Ray para ubicación y colas asincrónicas, vLLM para rollout, y NVIDIA AutoModel con FSDP2 para entrenamiento, sin bifurcar ninguno de los tres proyectos. Una arquitectura de grupos de agentes, motores vLLM detrás de un enrutador de solicitudes, y un único actor de política entrenable operacionaliza el pipeline. Tres invariantes de corrección—identidad de token, semántica de versión de política y consistencia forward—organizan el diseño, particularmente crítico para políticas mixture-of-experts.
Molt alcanza laboratorios de investigación de frontera y adyacentes, startups de IA bien financiadas que realizan entrenamiento posterior, grupos de investigación empresarial en finanzas y atención médica que entrenan agentes contra entornos propietarios, y laboratorios académicos con acceso a múltiples nós H100/H200. Las aplicaciones incluyen agentes multiturno de tool-use, agentes de ejecución de código y entornos visión-lenguaje.