OpenAI demuestra avance en aprendizaje por refuerzo profundo con equipo de agentes jugando Dota 2
OpenAI anunció un logro de aprendizaje por refuerzo donde un equipo de cinco agentes entrenados derrotó a jugadores de Dota 2 semi-profesionales con rendimiento de nivel de torneo. Los agentes fueron entrenados usando PPO (Proximal Policy Optimization), un algoritmo de aprendizaje por refuerzo desarrollado por OpenAI, sin exposición a datos de jugabilidad humana. El entrenamiento se basó en auto-juego en entornos simulados y diseño de función de recompensa, demostrando que el RL profundo puede abordar tareas de toma de decisiones complejas que combinan estrategia, coordinación en tiempo real y ejecución táctica a escala.