Pesquisa & Papers

OpenAI demonstra avanço em aprendizado por reforço profundo com time de agentes jogando Dota 2

OpenAIFonte: Sam Altman25/06/2018, 13:10
O OpenAI anunciou uma realização de aprendizado por reforço onde um time de cinco agentes treinados derrotou jogadores de Dota 2 semi-profissionais em desempenho de nível de torneio. Os agentes foram treinados usando PPO (Proximal Policy Optimization), um algoritmo de aprendizado por reforço desenvolvido pelo OpenAI, sem exposição a dados de jogabilidade humana. O treinamento se baseou em auto-jogo em ambientes simulados e design de função de recompensa, demonstrando que RL profundo pode abordar tarefas de tomada de decisão complexas combinando estratégia, coordenação em tempo real e execução tática em escala.
OpenAI demonstra avanço em aprendizado por reforço profundo com time de agentes jogando Dota 2 — lupAI