[论文解读] Planning with Expectation Models
本文提出 Gradient Dyna,一种基于模型的策略评估算法,通过利用一种新颖的目标函数——基于模型的均方投影贝尔曼误差(MB-MSPBE),在随机环境中使用期望模型进行规划。该方法在比以往工作更宽松的条件下证明了收敛性,并在实验中展示了即使标准方法发散时,仍能实现稳定且准确的价值函数学习。
Distribution and sample models are two popular model choices in model-based reinforcement learning (MBRL). However, learning these models can be intractable, particularly when the state and action spaces are large. Expectation models, on the other hand, are relatively easier to learn due to their compactness and have also been widely used for deterministic environments. For stochastic environments, it is not obvious how expectation models can be used for planning as they only partially characterize a distribution. In this paper, we propose a sound way of using approximate expectation models for MBRL. In particular, we 1) show that planning with an expectation model is equivalent to planning with a distribution model if the state value function is linear in state features, 2) analyze two common parametrization choices for approximating the expectation: linear and non-linear expectation models, 3) propose a sound model-based policy evaluation algorithm and present its convergence results, and 4) empirically demonstrate the effectiveness of the proposed planning algorithm.
研究动机与目标
- 解决在任意随机环境中使用期望模型(通常用于确定性环境)进行规划的挑战。
- 克服以往基于模型的策略评估方法在使用期望模型时存在的不稳定性和缺乏收敛性问题。
- 为在随机 MDP 中使用期望模型开发一种理论基础坚实、可收敛的策略评估算法。
- 证明线性状态特征值函数下,使用期望模型规划与使用完整分布模型规划的等价性。
- 提出一种新目标函数(MB-MSPBE),使学习过程更稳定且收敛条件弱于以往工作。
提出的方法
- 提出一种新的目标函数——基于模型的均方投影贝尔曼误差(MB-MSPBE),用于使用期望模型进行策略评估。
- 推导出一种基于梯度的规划算法(Gradient Dyna),通过最小化 MB-MSPBE 实现收敛,其收敛条件比以往方法更宽松。
- 采用基于特征的表示方法,使状态值在状态特征向量上线性化,从而实现与基于分布的规划在理论上的等价性。
- 应用在线模型学习,利用行为策略收集的经验数据,通过下一状态特征和奖励的均方误差更新期望模型。
- 实施搜索控制,从最近访问的状态中采样,以近似独立同分布条件,提升实际应用中的稳定性。
- 使用瓦片编码或学习到的特征表示将状态映射为固定维向量,从而在高维空间中实现高效的函数逼近。
实验结果
研究问题
- RQ1尽管仅捕捉部分分布信息,期望模型能否在随机环境中可靠地用于规划?
- RQ2在何种条件下,使用期望模型的规划与使用完整分布模型的规划等价?
- RQ3使用期望模型的基于模型策略评估算法能否在弱于以往方法的假设下实现收敛?
- RQ4期望模型的线性与非线性参数化选择如何影响性能与稳定性?
- RQ5基于梯度的期望模型算法能否在实践中实现稳定且准确的价值函数估计,即使标准方法发散?
主要发现
- Gradient Dyna 在 Four Rooms 和 Mountain Car 环境中均收敛至离策略 LSTD 解,后者的损失为 0.001,表明其具有高精度。
- 在一个反例领域中,使用线性和非线性期望模型的 TD(0) 导致价值函数发散,而 Gradient Dyna 保持稳定,并收敛至 RMSE 2.0。
- 理论分析表明,若价值函数在状态特征向量上线性,则使用期望模型的规划与使用分布模型的规划等价。
- 所提出的 MB-MSPBE 目标函数可在比以往工作(如 Sutton et al., 2012)更宽松的条件下实现收敛。
- 即使真实价值函数为线性,非线性期望模型在理论上也成立,因其具有更强的近似能力和稳定性。
- 实证结果证实,Gradient Dyna 在各类随机环境中均保持稳定与准确,优于在相同条件下发生发散的标准基于模型方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。