Avanços da hunyuan da tencent melhoram a eficiência do aprendizado por reforço com uma nova teoria de tamanho de lote
A equipe Hunyuan da Tencent introduziu uma nova abordagem para melhorar a eficiência do aprendizado por reforço em modelos grandes, redefinindo o conceito de tamanho de lote. A pesquisa se concentra na otimização de processos de treinamento onde os modelos geram seus próprios dados, abordando o desafio de alinhar a geração de rollout com a escala de treinamento. Ao ajustar a taxa de aprendizado dentro de uma faixa específica de tamanho de lote aumentado, a equipe afirma melhorar a eficácia do treinamento sem diluir os resultados de aprendizado. Este método demonstrou melhorias significativas na taxa de transferência, com fases de geração PPO vendo um aumento de 2,29x no desempenho. O estudo também destaca o potencial de reduzir o tempo de treinamento nas configurações GRPO em 29%.
A pesquisa enfatiza a importância de equilibrar as escalas de geração e treinamento para evitar ineficiências no aprendizado por reforço. Ao ajustar o tamanho de lote e a taxa de aprendizado críticos, a equipe visa abordar a lacuna de eficiência no aprendizado por reforço online. Esta inovação posiciona a Tencent como líder na utilização de hardware existente de forma mais econômica para treinar modelos grandes, mudando o foco do tamanho do modelo para a eficiência do treinamento.
Os resultados sugerem que a ênfase atual da indústria no tamanho do modelo pode ser obscurecida pela necessidade de processos de treinamento otimizados. A abordagem da Tencent fornece uma solução prática para melhorar o desempenho dos sistemas de aprendizado por reforço, oferecendo uma vantagem competitiva no rapidamente evoluindo cenário da IA.