[论文解读] Decoupled Reinforcement Learning to Stabilise Intrinsically-Motivated Exploration
本文提出解耦强化学习(DeRL),一种将内在探索与外在利用分别训练独立策略的框架,从而稳定基于内在奖励的探索。通过解耦探索与利用,DeRL在稀疏奖励环境中实现了对内在奖励超参数更高的鲁棒性以及更快的收敛速度和更高的样本效率。
Intrinsic rewards can improve exploration in reinforcement learning, but the exploration process may suffer from instability caused by non-stationary reward shaping and strong dependency on hyperparameters. In this work, we introduce Decoupled RL (DeRL) as a general framework which trains separate policies for intrinsically-motivated exploration and exploitation. Such decoupling allows DeRL to leverage the benefits of intrinsic rewards for exploration while demonstrating improved robustness and sample efficiency. We evaluate DeRL algorithms in two sparse-reward environments with multiple types of intrinsic rewards. Our results show that DeRL is more robust to varying scale and rate of decay of intrinsic rewards and converges to the same evaluation returns than intrinsically-motivated baselines in fewer interactions. Lastly, we discuss the challenge of distribution shift and show that divergence constraint regularisers can successfully minimise instability caused by divergence of exploration and exploitation policies.
研究动机与目标
- 解决由非平稳奖励设计和超参数敏感性引起的基于内在奖励探索的不稳定性。
- 降低对内在奖励尺度和衰减率等超参数手动调优的依赖。
- 提升在稀疏奖励环境中的样本效率和训练一致性。
- 将探索策略训练与利用策略优化解耦,以稳定学习过程。
- 研究探索与利用策略之间分布偏移的影响,并提出正则化方法以缓解发散。
提出的方法
- 使用组合奖励信号 r = r^e + λr^i 训练探索策略 πβ,其中 r^e 为外在奖励,r^i 为内在奖励。
- 使用仅外在奖励 r^e 在 πβ 收集的轨迹上训练利用策略 πe。
- 采用异策略和同策略强化学习算法(如 SAC、A2C)分别训练 πβ 和 πe。
- 在 πβ 和 πe 之间应用 KL 散度约束,以最小化分布偏移并稳定训练。
- 评估多种内在奖励类型:计数基(Ostrovski 等)、好奇心(Pathak 等)和内在好奇心(Burda 等)。
- 通过解耦策略训练,隔离内在奖励对探索的影响与主策略优化之间的相互作用。
实验结果
研究问题
- RQ1解耦探索与利用是否能降低对内在奖励超参数(如尺度和衰减率)的敏感性?
- RQ2与标准内在动机方法相比,DeRL 是否实现了更快的收敛速度和更高的样本效率?
- RQ3探索与利用策略之间的分布偏移如何影响学习稳定性?
- RQ4发散正则化(如 KL 约束)是否能有效稳定 DeRL 的训练?
- RQ5DeRL 在多种内在奖励机制和稀疏奖励环境中是否保持性能稳定?
主要发现
- DeRL 达到了与内在奖励基线相当的最终评估回报,但环境交互次数显著更少,证明了更高的样本效率。
- 在 DeepSea 10 环境中,使用计数基内在奖励的 DeRL 在所有计数增量下均达到 0.99±0.00 的最大回报,优于标准基线在超参数变化下的表现。
- 在 KL 散度约束(αβ = αe = 0.1)下,DeRL 即使在内在奖励缩放至 0.01 时仍保持稳定性能,避免了未正则化设置下的崩溃现象。
- 在 Hallway 环境中,带约束的 DeRL 在所有计数增量下实现了 0.84±0.07 的平均回报,而未正则化的版本在内在奖励过小时崩溃至 0.00±0.00。
- 仅使用内在奖励(r = λr^i)的 DeRL 在大多数设置下均无法学习,证实外在奖励对外在利用的稳定性至关重要。
- 该方法对内在奖励尺度和衰减率表现出鲁棒性,在从 0.01 到 100.0 的 7 种计数增量值下均保持一致性能,而标准基线在极端设置下会失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。