Skip to main content
QUICK REVIEW

[论文解读] Causal Dynamics Learning for Task-Independent State Abstraction

Zizhao Wang, Xuesu Xiao|arXiv (Cornell University)|Jun 27, 2022
Reinforcement Learning in Robotics被引用 6
一句话总结

本文提出因果动态学习(CDL),一种通过条件独立性检验识别并消除状态变量与动作之间虚假依赖关系,从而学习因果动态模型的方法。该方法实现了任务无关的状态抽象,提升了基于模型的强化学习中的泛化能力和样本效率,在模拟环境中对未见状态和下游任务的表现优于密集模型。

ABSTRACT

Learning dynamics models accurately is an important goal for Model-Based Reinforcement Learning (MBRL), but most MBRL methods learn a dense dynamics model which is vulnerable to spurious correlations and therefore generalizes poorly to unseen states. In this paper, we introduce Causal Dynamics Learning for Task-Independent State Abstraction (CDL), which first learns a theoretically proved causal dynamics model that removes unnecessary dependencies between state variables and the action, thus generalizing well to unseen states. A state abstraction can then be derived from the learned dynamics, which not only improves sample efficiency but also applies to a wider range of tasks than existing state abstraction methods. Evaluated on two simulated environments and downstream tasks, both the dynamics model and policies learned by the proposed method generalize well to unseen states and the derived state abstraction improves sample efficiency compared to learning without it.

研究动机与目标

  • 解决密集动态模型中虚假相关性导致的基于模型强化学习泛化能力差的问题。
  • 开发一种仅识别状态变量与动作之间必要依赖关系的因果动态模型。
  • 从因果模型中推导出任务无关的状态抽象,提升在多样化任务中的样本效率和泛化能力。
  • 克服奖励依赖型抽象(如双射)的局限性,后者会遗漏对未来任务有用的可控变量。

提出的方法

  • 该方法使用条件独立性检验,识别并消除动态模型中状态变量与动作之间的虚假依赖关系。
  • 提出一种新型神经架构,在动态模型的端到端训练过程中估计条件互信息。
  • 因果模型根据因果影响将状态变量划分为可控制、与动作相关和与动作无关的变量。
  • 所推导的状态抽象会忽略与动作无关的变量(如时钟),同时保留规划所需的必要动态信息。
  • 该方法支持使用稀疏且因果准确的模型进行规划,对分布外状态的泛化能力更强。
  • 通过使用由不同探索策略(包括PredDiff、Uniform和Curiosity)收集的数据进行评估,检验方法的鲁棒性。

实验结果

研究问题

  • RQ1能否从离线数据中学习到一种因果动态模型,通过消除虚假相关性,实现在未见状态上的良好泛化?
  • RQ2与密集模型相比,因果结构发现如何提升下游强化学习任务中的样本效率?
  • RQ3能否仅从动态信息中推导出任务无关的状态抽象,同时仍支持在多样化任务中的泛化能力?
  • RQ4不同探索策略如何影响所学习因果图的质量及后续模型性能?

主要发现

  • CDL在未见状态上实现了近乎完美的泛化,未见状态的预测准确率与已见状态相当,而密集模型在复杂环境中准确率下降了60–90%。
  • 即使在基于好奇心的探索策略收集的数据上,因果模型仍能学习到准确的因果图,尽管由于拖延行为导致召回率较低。
  • 使用所推导因果状态抽象训练的策略在所有下游任务中均表现出更高的样本效率和更好的泛化能力,优于使用密集模型的策略。
  • 该状态抽象成功忽略了与动作无关的变量(如时钟),同时保留了可控和与动作相关的变量,其任务适用范围广于依赖奖励的抽象方法。
  • 该方法在化学和操控环境中的表现优于当前最先进密集模型,泛化能力和样本效率均保持一致提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。