Skip to main content
QUICK REVIEW

[论文解读] Temporal Regularization in Markov Decision Process

Pierre Thodoroff, Audrey Durand|arXiv (Cornell University)|Nov 1, 2018
Reinforcement Learning in Robotics被引用 7
一句话总结

本文在马尔可夫决策过程(MDP)中引入时间正则化,利用价值估计随时间的平滑性来降低方差并提高学习稳定性。通过采用带衰减权重的过去状态价值加权和,该方法增强了对噪声或错误指定的状态表征的鲁棒性,在使用深度函数逼近时,于Atari游戏中也表现出性能提升。

ABSTRACT

Several applications of Reinforcement Learning suffer from instability due to high variance. This is especially prevalent in high dimensional domains. Regularization is a commonly used technique in machine learning to reduce variance, at the cost of introducing some bias. Most existing regularization techniques focus on spatial (perceptual) regularization. Yet in reinforcement learning, due to the nature of the Bellman equation, there is an opportunity to also exploit temporal regularization based on smoothness in value estimates over trajectories. This paper explores a class of methods for temporal regularization. We formally characterize the bias induced by this technique using Markov chain concepts. We illustrate the various characteristics of temporal regularization via a sequence of simple discrete and continuous MDPs, and show that the technique provides improvement even in high-dimensional Atari games.

研究动机与目标

  • 为解决强化学习中的高方差问题,特别是在高维和噪声环境中。
  • 探索时间正则化作为价值函数估计中空间正则化的补充方法。
  • 利用马尔可夫链理论,正式刻画时间正则化引入的偏差。
  • 评估时间正则化对错误指定或噪声状态特征的鲁棒性。
  • 在离散和连续MDP中(包括Atari环境)证明时间正则化的有效性。

提出的方法

  • 提出一种时间正则化价值函数估计方法,将当前价值与过去状态价值的加权平均结合,采用指数衰减。
  • 将正则化价值定义为 $ v_{\text{reg}}(s_t) = v(s_t) + \lambda \widetilde{v}(s_{t-1}) $,其中 $ \widetilde{v}(s_{t-1}) $ 是先前价值估计的指数衰减和。
  • 使用马尔可夫链概念(包括细致平衡和逆向链)分析正则化估计的偏差与收敛特性。
  • 在策略评估与控制设置中应用该方法,并通过PPO与帧堆叠状态表征扩展至深度强化学习。
  • 为正则化强度 $ \beta $ 设计衰减调度,以随时间减少偏差,尤其适用于深度学习实验。
  • 使用归一化性能指标(公式12)在离散MDP、连续MDP和Atari学习环境上验证该方法。

实验结果

研究问题

  • RQ1时间正则化能否通过强制时间上的平滑性来降低价值函数估计的方差?
  • RQ2时间正则化如何影响MDP中的偏差与收敛性?能否利用马尔可夫链理论进行形式化刻画?
  • RQ3时间正则化是否能提升在状态表征存在噪声或错误指定环境中的样本效率与鲁棒性?
  • RQ4在性能与稳定性方面,时间正则化与空间正则化及多步方法相比如何?
  • RQ5时间正则化能否在深度强化学习设置(如采用帧堆叠状态表征的Atari游戏)中提升学习效果?

主要发现

  • 时间正则化显著提升了多个Atari游戏的性能,根据公式(12)的归一化指标衡量,表明样本效率与稳定性均得到改善。
  • 该方法在离散与连续MDP中均能降低估计误差与方差,即使在使用深度神经网络进行函数逼近时亦然。
  • 时间正则化对噪声或错误指定的状态特征具有鲁棒性,在状态表征不完善的环境中优于基线方法。
  • 在10个随机种子和7款游戏中,性能增益保持一致,超参数 $ \beta = \lambda = 0.2 $ 及衰减率 $ 1\times10^{-5} $ 通过验证选定。
  • 正则化使最优价值函数更加平滑,这可能解释了在高维设置中更快的收敛速度与更好的泛化能力。
  • 随时间衰减正则化强度可减轻其引入的偏差,提示其为长期训练提供实用策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。