[论文解读] Successor-Predecessor Intrinsic Exploration
本文提出了一种新型内在探索方法——后继-前驱内在探索(SPIE),该方法结合了前瞻性后继表示(SR)与回溯性前驱表示(PR),以在稀疏奖励环境中实现高效且具备结构感知能力的探索。SPIE在样本效率和渐近性能方面优于先前方法,在仅使用 8×10⁶ 帧的情况下即在《蒙特祖马的复仇》中达到接近最优性能,显著快于 DQN-SR 和 RND。
Exploration is essential in reinforcement learning, particularly in environments where external rewards are sparse. Here we focus on exploration with intrinsic rewards, where the agent transiently augments the external rewards with self-generated intrinsic rewards. Although the study of intrinsic rewards has a long history, existing methods focus on composing the intrinsic reward based on measures of future prospects of states, ignoring the information contained in the retrospective structure of transition sequences. Here we argue that the agent can utilise retrospective information to generate explorative behaviour with structure-awareness, facilitating efficient exploration based on global instead of local information. We propose Successor-Predecessor Intrinsic Exploration (SPIE), an exploration algorithm based on a novel intrinsic reward combining prospective and retrospective information. We show that SPIE yields more efficient and ethologically plausible exploratory behaviour in environments with sparse rewards and bottleneck states than competing methods. We also implement SPIE in deep reinforcement learning agents, and show that the resulting agent achieves stronger empirical performance than existing methods on sparse-reward Atari games.
研究动机与目标
- 解决在局部信号(如访问次数)无法有效引导智能体发现结构上重要的状态(如瓶颈状态)的稀疏奖励环境中探索效率低下的问题。
- 将回溯信息(前驱结构)与前瞻性信息(后继表示)相结合,构建更具全局感知能力的内在奖励。
- 开发一种通用的内在探索框架,以提升离散与连续MDP中样本效率和渐近回报。
- 通过将SPIE与DQN结合并在性能上与SOTA方法(如RND和DQN-SR)对比,验证其在深度强化学习中的有效性。
- 探索SPIE在结构化环境中建模生物上合理、类似循环的探索行为的潜力。
提出的方法
- SPIE通过结合后继表示(SR,用于捕捉未来状态的占据情况)与前驱表示(PR,用于编码预期的过去状态)来构建内在奖励。
- 内在奖励被定义为SR与PR的加权和,使智能体能够优先关注在未来可到达性方面具有潜力、且在状态空间中具有关键连通性的状态。
- 对于离散MDP,SPIE使用表格型SR与PR,基于对未来和过去状态访问的期望来计算内在奖励。
- 对于连续MDP,SPIE引入了“前驱特征”——一种基于神经网络的PR泛化形式,以捕捉高维状态空间中的回溯结构。
- 该方法通过将SPIE内在奖励与外部奖励结合,集成到深度Q网络(DQN)中,支持在线时序差分学习。
- SPIE设计为模块化且与任意深度强化学习智能体兼容,可无缝集成至现有算法中。
实验结果
研究问题
- RQ1结合回溯(前驱)与前瞻性(后继)信息是否能提升稀疏奖励环境中探索的效率?
- RQ2SPIE是否能比仅依赖局部访问次数或未来前景的方法更有效地识别并穿越瓶颈状态?
- RQ3在Atari游戏中,SPIE在样本效率和渐近性能方面与SOTA内在探索方法(如RND和DQN-SR)相比表现如何?
- RQ4SPIE能否在无外部塑造的情况下,产生类似循环的、符合生物学行为学的探索行为(如在结构化网格世界中于不同状态簇间循环)?
- RQ5将SPIE与深度强化学习智能体结合,对连续与离散控制任务的学习动态和最终性能有何影响?
主要发现
- SPIE仅用约 8×10⁶ 次训练帧即在《蒙特祖马的复仇》中达到接近渐近性能,而DQN-SR则需约 2.4×10⁷ 帧才能达到更低得分。
- 在Freeway环境中,SPIE优于DQN、DQN-MMC、RND和DQN-SR,平均得分为27.5(±0.2),优于RND的28.2和DQN-SR的29.4。
- 在Gravitar中,SPIE平均得分为1223.0(±408.9),显著优于RND(714.1)和DQN-SR(457.4)。
- 在Private Eye中,SPIE达到488.2(±390.9)的平均得分,超过RND(61.3)和DQN-SR(104.4),展现出在复杂探索任务中的鲁棒性。
- SPIE在网格世界中表现出符合生物学行为学的探索行为,包括在不同状态簇之间循环,表明其具备结构感知探索能力。
- SPIE与DQN结合后,在所有六个测试的高难度探索Atari游戏中均实现一致性能提升,样本效率更优,渐近回报更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。