[论文解读] Rewarding Episodic Visitation Discrepancy for Exploration in Reinforcement Learning
本文提出奖励性剧集访问差异(REVD),一种计算高效的内在探索方法,利用基于Rényi散度的剧集间访问差异生成持续的探索奖励。通过使用随机初始化的状态编码器结合k近邻估计器,REVD避免了辅助模型和表征学习,显著提升了样本效率,并在Atari和PyBullet环境中优于SOTA方法。
Exploration is critical for deep reinforcement learning in complex environments with high-dimensional observations and sparse rewards. To address this problem, recent approaches proposed to leverage intrinsic rewards to improve exploration, such as novelty-based exploration and prediction-based exploration. However, many intrinsic reward modules require sophisticated structures and representation learning, resulting in prohibitive computational complexity and unstable performance. In this paper, we propose Rewarding Episodic Visitation Discrepancy (REVD), a computation-efficient and quantified exploration method. More specifically, REVD provides intrinsic rewards by evaluating the Rényi divergence-based visitation discrepancy between episodes. To make efficient divergence estimation, a k-nearest neighbor estimator is utilized with a randomly-initialized state encoder. Finally, the REVD is tested on Atari games and PyBullet Robotics Environments. Extensive experiments demonstrate that REVD can significantly improves the sample efficiency of reinforcement learning algorithms and outperforms the benchmarking methods.
研究动机与目标
- 为解决深度强化学习中内在奖励衰减的问题,特别是在稀疏奖励和高维观测环境中的挑战。
- 开发一种计算高效的探索方法,避免复杂的表征学习与辅助模型。
- 提供一种可量化的、基于剧集级别的度量指标,用于衡量跨剧集的探索改进程度。
- 在不增加模型复杂度的前提下,提升离散控制与连续控制任务中的样本效率与策略性能。
提出的方法
- REVD基于连续剧集间状态访问分布的Rényi散度计算内在奖励。
- 通过将k近邻(k-NN)估计器应用于当前剧集与前一剧集的状态,估计该散度。
- 使用随机初始化的状态编码器对状态进行嵌入,避免对预训练或学习到的表征的依赖。
- 该方法无需剧集记忆或数据库,可在剧集间持续提供探索激励。
- 内在奖励源自某状态与其邻居在两个连续剧集中的k-NN距离差异。
- 该方法可无缝集成至标准强化学习算法(如PPO和A2C),无需修改其核心架构。
实验结果
研究问题
- RQ1基于剧集访问差异的计算高效探索方法,是否能在样本效率上超越现有内在奖励方法?
- RQ2REVD是否能在不依赖记忆或表征学习的情况下,维持跨剧集的强探索激励?
- RQ3在稀疏奖励环境中,REVD与SOTA方法(如RE3、RIDE和NGU)相比,在性能与稳定性方面表现如何?
- RQ4REVD是否能提升离散控制(Atari)与连续控制(PyBullet)任务中的学习效率?
- RQ5所提出的访问差异度量是否为剧集级别探索改进提供了可靠且可量化的指标?
主要发现
- 在所有六个Atari游戏中,无论奖励密集与否,REVD均显著提升了样本效率,优于PPO+RIDE、PPO+RE3与原始PPO。
- 在Atari的稀疏奖励设置下,REVD在Assault环境中表现出振荡的学习曲线,表明其具备强大且持续的探索激励。
- 在PyBullet机器人环境中,PPO+REVD在Walker 2D任务中获得了最高的平均剧集回报,在Hopper与Humanoid任务中实现了最快收敛。
- 在Cart Pole任务中,PPO+REVD以最少的环境交互步数完成任务,展现出卓越的样本效率。
- A2C+REVD在所有PyBullet任务中均优于原始A2C,包括Half Cheetah与Humanoid,证实了REVD在不同强化学习算法上的鲁棒性。
- 在所有评估任务中,REVD在密集与稀疏奖励设置下均持续优于基线方法,验证了其有效性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。