Pesquisa & Papers

Estratégias de exploração em ambientes de aprendizado por reforço profundo

Fonte: Lilian Weng06/06/2020, 21:00
Este artigo técnico aborda o tradeoff exploração-exploração fundamental ao aprendizado por reforço, examinando estratégias para descobrir soluções ótimas eficientemente evitando comprometimento prematuro com políticas subótimas. O levantamento cobre algoritmos de bandido clássicos e sua aplicação ao aprendizado por reforço profundo com aproximação de função de rede neural. O artigo discute dois cenários de desafio crítico: problemas de exploração difícil com recompensas escassas ou enganosas, e o problema TV ruidoso onde agentes otimizando por novidade podem perseguir estímulos sem sentido. Benchmarks específicos como Montezuma's Revenge exemplificam ambientes requerendo exploração sofisticada. Várias técnicas de exploração moderna são apresentadas para abordar esses cenários, reconhecendo que exploração permanece um problema de pesquisa aberto em RL profundo onde nenhuma abordagem única domina em todas as classes de problema.
Estratégias de exploração em ambientes de aprendizado por reforço profundo — lupAI