Skip to main content
QUICK REVIEW

[论文解读] Causally Correct Partial Models for Reinforcement Learning

Danilo Jimenez Rezende, Ivo Danihelka|arXiv (Cornell University)|Feb 7, 2020
Reinforcement Learning in Robotics参考文献 45被引用 16
一句话总结

本文提出了用于强化学习的因果正确部分模型(CPMs),通过引入潜在的后门变量来解决部分模型中的混淆问题,确保在不完整观测建模的情况下实现因果准确的规划。该方法通过显式建模混淆因子,在随机环境中实现了更优的策略评估与规划性能,相较于非因果部分模型,其在表格型MDP和3D环境中均表现出色,且计算开销极低。

ABSTRACT

In reinforcement learning, we can learn a model of future observations and rewards, and use it to plan the agent's next actions. However, jointly modeling future observations can be computationally expensive or even intractable if the observations are high-dimensional (e.g. images). For this reason, previous works have considered partial models, which model only part of the observation. In this paper, we show that partial models can be causally incorrect: they are confounded by the observations they don't model, and can therefore lead to incorrect planning. To address this, we introduce a general family of partial models that are provably causally correct, yet remain fast because they do not need to fully model future observations.

研究动机与目标

  • 识别并形式化基于模型的强化学习中现有部分模型的因果缺陷。
  • 解决部分模型中的混淆问题,即未建模的观测会扭曲因果推断并导致错误规划。
  • 开发一个通用的部分模型家族,其在保证计算高效的同时,可被严格证明具有因果正确性。
  • 在简单MDP、MiniPacman和3D环境中对所提出的CPM框架进行实证验证,证明其在策略评估与规划准确性方面的改进。

提出的方法

  • 提出一种因果框架,通过条件化于表示未观测混淆因子的潜在后门变量,使部分模型具备因果正确性。
  • 引入一种模型架构,用于学习潜在后门变量 $ z_t $ 的条件分布 $ p(z_t | h_t) $,其中 $ h_t $ 是RNN编码器的隐藏状态。
  • 使用狄利克雷分布的混合模型来建模 $ p(z_t | h_t) $,并通过深度神经网络参数化浓度参数,以捕捉后门变量中的不确定性和结构。
  • 采用两阶段训练流程:首先对模型进行预训练,以从动作和隐藏状态预测未来观测;随后通过因果目标进行微调,使模型预测与策略结果对齐。
  • 通过强制执行动作和强制执行后门变量的滚动仿真,评估模型在反事实干预下的行为表现。
  • 采用基于多条轨迹采样点的条件生成损失,以提升模型的鲁棒性与不确定性估计能力。

实验结果

研究问题

  • RQ1即使在分布预测准确的情况下,基于模型的强化学习中的部分模型是否仍可能因未建模的混淆因子而导致因果错误?
  • RQ2在策略变化下,为确保因果正确性,部分模型中必须包含的最小变量集合是什么?
  • RQ3通过避免完整观测建模,部分模型能否同时实现因果正确性与计算高效性?
  • RQ4在随机环境中,引入潜在后门变量如何提升策略评估与规划性能?

主要发现

  • 在FuzzyBear和AvoidFuzzyBear MDP中,非因果部分模型(NCPM)错误地将选择前往森林的策略评估为最优,尽管最优策略实际上是待在家中。
  • 因果正确部分模型(CPM)在AvoidFuzzyBear中正确识别出待在家中为最优策略,对所有策略的评估值恒为0.6,与真实最大期望奖励完全一致。
  • 在MiniPacman中,CPM在策略评估方面优于NCPM,对500个随机生成策略的值函数估计均方误差更低。
  • 在3D环境中,CPM在训练初期即保持多样化且逼真的滚动仿真,避免了NCPM在策略趋于确定性时出现的过度乐观现象。
  • CPM通过显式建模作为混淆因子的潜在后门变量,对策略变化保持鲁棒性,并避免了虚假相关性。
  • 在非零探索($\varepsilon$-探索)条件下,CPM避免了滚动仿真中的过度自信,即使在训练后期也能维持准确的不确定性估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。