[论文解读] Adversarially Guided Actor-Critic
本文提出对抗性引导的演员-critic(AGAC),一种新颖的演员-critic框架,通过引入一个判别器来提升稀疏奖励、程序化生成环境中的探索能力。通过训练演员欺骗判别器(同时判别器模仿演员的策略),该方法促使产生多样化、创新的行为,相较于最先进方法,在硬探索任务中展现出更优的样本效率和性能。
Despite definite success in deep reinforcement learning problems, actor-critic algorithms are still confronted with sample inefficiency in complex environments, particularly in tasks where efficient exploration is a bottleneck. These methods consider a policy (the actor) and a value function (the critic) whose respective losses are built using different motivations and approaches. This paper introduces a third protagonist: the adversary. While the adversary mimics the actor by minimizing the KL-divergence between their respective action distributions, the actor, in addition to learning to solve the task, tries to differentiate itself from the adversary predictions. This novel objective stimulates the actor to follow strategies that could not have been correctly predicted from previous trajectories, making its behavior innovative in tasks where the reward is extremely rare. Our experimental analysis shows that the resulting Adversarially Guided Actor-Critic (AGAC) algorithm leads to more exhaustive exploration. Notably, AGAC outperforms current state-of-the-art methods on a set of various hard-exploration and procedurally-generated tasks.
研究动机与目标
- 解决深度强化学习中样本效率低下和探索能力差的问题,特别是在稀疏奖励和程序化生成环境中。
- 提升在复杂、动态演化环境中训练的智能体的泛化能力和行为多样性。
- 探究对抗性训练是否能在不依赖内在好奇心或计数奖励机制的情况下引导探索。
- 评估所提出的对抗性正则化在演员-critic框架中的稳定性和可扩展性。
提出的方法
- 引入第三个智能体——判别器,其目标是通过最小化KL散度来预测演员的动作分布。
- 演员被训练以最小化标准强化学习损失和一种对抗性损失,后者鼓励其行为偏离判别器的预测。
- 判别器被训练以最小化其自身动作分布与演员动作分布之间的KL散度,从而有效充当策略行为的判别器。
- 将对抗性目标与标准演员-critic损失相结合,形成联合优化,平衡任务性能与行为多样性。
- 该方法利用来自判别器预测误差的奖励信号,以在稀疏奖励设置中鼓励探索。
- 在固定(单例)环境和程序化生成环境中对框架进行了评估,以检验其泛化能力和探索有效性。
实验结果
研究问题
- RQ1演员与第三方判别器之间的对抗性模仿能否提升深度强化学习中的探索能力?
- RQ2在样本效率和覆盖范围方面,对抗性目标与内在好奇心和基于计数的探索方法相比如何?
- RQ3判别器驱动的行为多样性在多大程度上提升了智能体对未见程序化生成环境的泛化能力?
- RQ4在不同超参数下,特别是对抗性奖励系数变化时,训练过程的稳定性如何?
- RQ5该方法是否能在无外在奖励的情况下实现全面探索?
主要发现
- AGAC在MiniGrid中的多个硬探索任务中达到最先进性能,优于RIDE、AMiGo、RND、ICM和基于计数的方法。
- 在无奖励设置下,AGAC在MultiRoomN10S6环境中探索了全部10间房,而RIDE仅到达第5间房,其他方法探索效率更低。
- 该方法通过多样化、非重复的行为(包括来回移动和返回起点策略)实现了全面探索,即使在单例环境中亦是如此。
- 通过最后10集的状态访问热力图可见,判别器成功驱动了行为多样性,各集间展现出明显不同的策略。
- AGAC在适度依赖对抗性奖励系数的情况下表现出可接受的稳定性,表明其具有实际可用性。
- 在VizDoom环境中,对抗性引导的奖励显著优于基线内在好奇心方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。