Skip to main content
QUICK REVIEW

[论文解读] Model-Based Regularization for Deep Reinforcement Learning with Transcoder Networks

Felix Leibfried, Peter Vrancx|arXiv (Cornell University)|Sep 6, 2018
Reinforcement Learning in Robotics参考文献 40被引用 6
一句话总结

本文提出一种转换器网络(transcoder network),通过将环境模型预测误差作为正则项引入深度Q网络(DQN)的价值学习目标,实现了基于模型的正则化。该方法在20款Atari游戏中显著提升了样本效率与性能,取得了更高的中位数归一化得分,并在14款游戏中超越了原始DQN模型。

ABSTRACT

This paper proposes a new optimization objective for value-based deep reinforcement learning. We extend conventional Deep Q-Networks (DQNs) by adding a model-learning component yielding a transcoder network. The prediction errors for the model are included in the basic DQN loss as additional regularizers. This augmented objective leads to a richer training signal that provides feedback at every time step. Moreover, because learning an environment model shares a common structure with the RL problem, we hypothesize that the resulting objective improves both sample efficiency and performance. We empirically confirm our hypothesis on a range of 20 games from the Atari benchmark attaining superior results over vanilla DQN without model-based regularization.

研究动机与目标

  • 解决在稀疏奖励设置下深度强化学习中的样本效率低下问题。
  • 通过将模型预测误差引入价值学习目标,丰富训练信号。
  • 通过联合训练价值网络与预测性环境模型,提升性能与样本效率。
  • 探究策略与模型学习共享参数架构是否能带来更好的泛化能力与更快的收敛速度。
  • 证明基于模型的正则化可在高维控制任务(如Atari游戏)中实现更优性能与更快的学习速度。

提出的方法

  • 扩展标准DQN,引入一种共享架构的转换器网络,联合学习价值函数与环境动态。
  • 构建复合损失函数,将标准DQN的Q值损失与模型预测损失结合,作为正则项。
  • 利用环境模型对下一状态与奖励的预测误差,在每个时间步提供辅助训练信号。
  • 端到端训练转换器网络,采用联合优化目标,同时最小化Q值Bellman误差与模型预测误差。
  • 采用优先经验回放机制以稳定训练并提升数据效率。
  • 在价值头与模型头之间共享参数,以实现参数效率与归纳偏置的迁移。

实验结果

研究问题

  • RQ1模型预测误差能否作为有效正则项,提升深度Q学习的样本效率?
  • RQ2联合学习价值函数与环境模型是否能提升在稀疏奖励Atari游戏中的性能?
  • RQ3转换器网络架构在收敛速度与最终性能方面相较于标准DQN有何差异?
  • RQ4基于模型的正则化在多大程度上减少了达到峰值性能所需的环境交互次数?
  • RQ5价值与模型学习共享参数的架构能否在多样化Atari环境中保持或提升泛化能力?

主要发现

  • 所提出的转换器网络在20款Atari游戏中实现了85.0%的中位数人类归一化得分,显著优于DQN基线的60.7%。
  • 该方法在20款Atari游戏中的14款上优于原始DQN,尤其在高难度环境如Battle Zone(83.7% vs. 20.2%)与Crazy Climber(378.7% vs. 234.3%)中表现突出。
  • 样本效率得到提升,该方法在全部五款独立游戏及20款游戏的中位数上均比DQN更快达到峰值性能。
  • 复合损失函数主要由Q值损失主导,基于模型的正则化仅产生温和但有效的影响力,表明联合优化过程稳定。
  • 实现了对未来视频帧与奖励的准确预测,证明了模型学习到有意义的环境动态。
  • 转换器网络架构成功在策略头与模型头之间共享参数,实现了高效联合训练且未造成性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。