[论文解读] Munchausen Reinforcement Learning
本论文提出 Munchausen Reinforcement Learning (M-RL),通过将奖励与缩放的对数策略相结合来引导学习;它产生 M-DQN 和 M-IQN,在 Atari 上超越非分布式和分布式基线,并给出关于隐式 KL 正则化和动作间隙增加的理论洞见。
Bootstrapping is a core mechanism in Reinforcement Learning (RL). Most algorithms, based on temporal differences, replace the true value of a transiting state by their current estimate of this value. Yet, another estimate could be leveraged to bootstrap RL: the current policy. Our core contribution stands in a very simple idea: adding the scaled log-policy to the immediate reward. We show that slightly modifying Deep Q-Network (DQN) in that way provides an agent that is competitive with distributional methods on Atari games, without making use of distributional RL, n-step returns or prioritized replay. To demonstrate the versatility of this idea, we also use it together with an Implicit Quantile Network (IQN). The resulting agent outperforms Rainbow on Atari, installing a new State of the Art with very little modifications to the original algorithm. To add to this empirical study, we provide strong theoretical insights on what happens under the hood -- implicit Kullback-Leibler regularization and increase of the action-gap.
研究动机与目标
- 激励在 TD 学习中将当前策略作为引导信号来利用。
- 提出一个简单、通用的 Munchausen 更新,将缩放的对数策略加入奖励中。
- 通过将其应用于 DQN 和 IQN 并与强基线进行比较来证明该方法的有效性。
- 通过隐式 KL 正则化和动作间隙分析提供理论解释。
提出的方法
- 在奖励中加入 alpha 乘以 tau 乘以 log pi(a|s) 的项以增强 TD 目标。
- 将 DQN 广义化为最大熵强化学习,然后引入 Munchausen 项以得到 M-DQN。
- 将 Munchausen 思路应用于 IQN 以得到 M-IQN,并在 Atari 上展示最先进的性能。
- 在抽象的动态规划框架中重写 M-DQN,以揭示连续策略之间的隐式 KL 正则化。
- 分析动作间隙放大效应,并将 M-RL 与 CVI、DPP 和 AL 联系起来。
- 开展经验消融实验以分离 Munchausen 的贡献并评估超参数 alpha、tau 以及对数策略截断的鲁棒性。
实验结果
研究问题
- RQ1将奖励与缩放的对数策略相结合是否能在样本效率和性能上优于标准的 TD 方法?
- RQ2在 Atari 上,Munchausen RL 是否能够在没有分布式强化学习技巧的情况下提供具有竞争力或更优的性能?
- RQ3随 Munchausen 更新而来的哪些理论保证或解释(如 KL 正则化、动作间隙增加)?
- RQ4Munchausen RL 如何扩展到分布式 RL 设置(如 IQN),并对最先进基线产生何种影响?
主要发现
- M-DQN 在 Atari 的 60 个游戏中显著优于 DQN 和 C51,原因是在回归目标上的一个简单修改。
- M-IQN 超越 Rainbow,在非分布式基线中达到新的最先进结果,并且与分布式 RL 代理相比具有竞争力。
- M-DQN 与 M-IQN 受益于连续策略之间的隐式 KL 正则化效应,提升稳定性及误差平均。
- Munchausen 框架以可量化的方式增加动作间隙,从而提高对近似误差的鲁棒性。
- 消融研究表明 Munchausen 更新优于 Soft-DQN、AL 与 Adam DQN,强调 Munchausen 项的价值不仅仅在于熵正则化。
- 理论联系将 M-VI 与 MD-VI 以及 CVI/DPP/AL 文献联系起来,给出在存在函数近似时解释更好收敛性的界限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。