Skip to main content
QUICK REVIEW

[论文解读] Counterfactual Data Augmentation using Locally Factored Dynamics

Silviu Pitis, Elliot Creager|arXiv (Cornell University)|Jul 6, 2020
Reinforcement Learning in Robotics参考文献 89被引用 11
一句话总结

本文提出反事实数据增强(CoDA),一种利用动态环境中局部分解的因果结构来生成因果有效反事实经验的方法。通过注意力机制进行结构发现,识别局部独立的子过程,并在观测轨迹之间交换组件,CoDA 在无需前向动力学模型的情况下,提升了无模型强化学习的样本效率,显著增强了在批量约束和目标条件强化学习设置下的性能。

ABSTRACT

Many dynamic processes, including common scenarios in robotic control and reinforcement learning (RL), involve a set of interacting subprocesses. Though the subprocesses are not independent, their interactions are often sparse, and the dynamics at any given time step can often be decomposed into locally independent causal mechanisms. Such local causal structures can be leveraged to improve the sample efficiency of sequence prediction and off-policy reinforcement learning. We formalize this by introducing local causal models (LCMs), which are induced from a global causal model by conditioning on a subset of the state space. We propose an approach to inferring these structures given an object-oriented state representation, as well as a novel algorithm for Counterfactual Data Augmentation (CoDA). CoDA uses local structures and an experience replay to generate counterfactual experiences that are causally valid in the global model. We find that CoDA significantly improves the performance of RL agents in locally factored tasks, including the batch-constrained and goal-conditioned settings.

研究动机与目标

  • 通过利用动态系统中局部因果独立性来提升强化学习的样本效率。
  • 开发一种数据增强策略,无需依赖学习到的前向动力学模型即可生成反事实经验。
  • 将局部因果模型(LCMs)形式化为从全局因果结构中推导出的条件独立子过程。
  • 仅使用观测轨迹和面向对象的状态表示,实现高效且因果有效的数据合成。
  • 证明 CoDA 在多种强化学习基准测试中均能提升性能,包括批量约束和目标条件设置。

提出的方法

  • 该方法引入局部因果模型(LCMs),通过在状态空间的子集上对全局因果模型进行条件化,以识别局部独立的子过程。
  • 采用基于注意力机制的架构(SANDy-Transformer)从解耦的状态表示中推断局部因果结构,识别在每个时间步哪些子过程是因果独立的。
  • 通过在观测轨迹对之间交换独立子过程的组件(例如物体位置或动作),生成反事实转移,确保因果有效性。
  • 该方法完全基于经验回放缓冲区运行,与任何智能体架构(包括未分解的模型)兼容。
  • 提出一种局部条件化的 CoDA 变体,确保仅生成因果上可能的组合,避免无效或不一致的转移。
  • 通过合成环境和真实世界环境(包括 Spriteworld 和 MuJoCo 任务)的组合进行评估,并对结构发现和数据增强的有效性进行消融研究。

实验结果

研究问题

  • RQ1能否从动态环境中的观测轨迹中可靠地推断出局部分解的因果结构?
  • RQ2通过在轨迹之间交换组件生成的反事实数据,是否能提升强化学习中的样本效率?
  • RQ3与标准数据增强和基于模型的基线相比,CoDA 在泛化能力和训练稳定性方面表现如何?
  • RQ4使用局部条件化的反事实是否能提升在批量约束和目标条件强化学习设置下的性能?
  • RQ5访问真实局部分解信息在多大程度上能提升动力学模型训练效果?CoDA 能否近似实现这一优势?

主要发现

  • CoDA 显著提升了无模型强化学习的样本效率,尤其在批量约束和目标条件设置下,优于标准数据增强和基线方法。
  • 使用 2000 个真实转移和 35,000 个生成的反事实数据,CoDA 减少了过拟合现象,并提升了前向动力学建模的验证性能,证明了该方法具有正则化效应。
  • SANDy-Transformer 模型在识别局部因果结构方面优于 SANDy-Mixture,尤其在检测物体与动作之间的交互方面,得益于其更强的归纳偏置。
  • 即使采用简单的随机重标记基线,CoDA 仍表现出更好的泛化能力,但使用学习到的局部结构后性能显著提升,凸显了因果有效性的关键作用。
  • 在 CoDA 增强数据上训练的动力学模型,其长期轨迹生成和碰撞建模能力优于仅使用真实数据训练的模型,尽管两者在下一状态预测误差上相似。
  • 该方法无需前向动力学模型即可实现有效的数据增强,因此可广泛应用于现有强化学习智能体和架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。