Skip to main content
QUICK REVIEW

[论文解读] An Information-Theoretic Optimality Principle for Deep Reinforcement Learning

Felix Leibfried, Jordi Grau-Moya|arXiv (Cornell University)|Aug 6, 2017
Reinforcement Learning in Robotics参考文献 50被引用 16
一句话总结

本文提出了一种新颖的信息论最优性原则,用于深度强化学习,通过引入源自信息论的内在惩罚信号,减少Q值过估计。通过动态调度拉格朗日乘子以控制该惩罚,该方法在Atari游戏中实现了优于DQN、Double DQN和Soft Q-Learning的样本效率和性能,其改进效果在标准架构和双分枝网络架构下均得到验证。

ABSTRACT

We methodologically address the problem of Q-value overestimation in deep reinforcement learning to handle high-dimensional state spaces efficiently. By adapting concepts from information theory, we introduce an intrinsic penalty signal encouraging reduced Q-value estimates. The resultant algorithm encompasses a wide range of learning outcomes containing deep Q-networks as a special case. Different learning outcomes can be demonstrated by tuning a Lagrange multiplier accordingly. We furthermore propose a novel scheduling scheme for this Lagrange multiplier to ensure efficient and robust learning. In experiments on Atari, our algorithm outperforms other algorithms (e.g. deep and double deep Q-networks) in terms of both game-play performance and sample complexity. These results remain valid under the recently proposed dueling architecture.

研究动机与目标

  • 为解决深度强化学习中因Q值过估计导致的高维状态空间下样本效率降低的问题。
  • 将原本用于表格型强化学习的信息论原则,适配至连续和高维环境中的深度函数逼近器。
  • 构建一个统一的优化框架,通过可调超参数使DQN成为该框架的特例。
  • 通过动态调度内在惩罚信号,提升深度强化学习的样本效率和最终性能。
  • 在多种Atari环境中验证该方法,包括双分枝架构。

提出的方法

  • 提出一种新颖的优化目标,结合基于当前策略与参考策略之间差异的信息论惩罚项。
  • 使用拉格朗日乘子控制内在惩罚的强度,从而在DQN与更保守的Q值估计之间实现学习行为的连续谱。
  • 采用动态调度方案对拉格朗日乘子进行调整,基于时序贝尔曼误差的演化自适应平衡探索与稳定性。
  • 将该方法应用于深度Q网络(DQN)和双分枝架构,实现在各类环境中的稳定性能提升。
  • 利用价值优势稳健计算惩罚信号,提升训练稳定性。
  • 采用指数平滑处理回合奖励,以实现学习曲线的清晰可视化与对比。

实验结果

研究问题

  • RQ1信息论原则能否在高维强化学习的深度函数逼近器中有效应用,以减少Q值过估计?
  • RQ2引入基于策略差异的动态惩罚信号,是否能提升深度强化学习的样本效率和最终性能?
  • RQ3所提出的方法能否通过可调拉格朗日乘子,将DQN及其他Q学习变体统一于单一优化框架之下?
  • RQ4与SOTA基线方法(如Double DQN和Soft Q-Learning)相比,该方法在游戏性能和样本复杂度方面表现如何?
  • RQ5当与所提出的基于信息论的惩罚结合时,双分枝架构是否能进一步提升性能?

主要发现

  • 所提出的方法(称为DIN,Dynamic Information-theoretic Network)在20款Atari游戏中,中位归一化得分上优于DQN和Double DQN,显著提升了性能与样本效率。
  • 在Road Runner环境中,DIN在约2×10⁷次训练迭代内达到峰值性能,而Double DQN和标准DQN分别需3×10⁷和5×10⁷次迭代(使用标准架构)。
  • 该方法在无需对拉格朗日乘子λ进行预调优的情况下,性能优于Soft Q-Learning(SQL),在Road Runner上约500万次迭代内即超越SQL的最佳结果。
  • DIN生成的Q值估计始终低于DQN和Double DQN,证实了其对过估计偏差的降低。
  • 当与双分枝架构结合时,DIN进一步提升了性能,表明其与现代深度强化学习架构具有良好的兼容性与协同效应。
  • 拉格朗日乘子的动态调度带来了更稳定高效的训练过程,表现为更平滑的学习曲线和更快的收敛速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。