Skip to main content
QUICK REVIEW

[论文解读] Object-Aware Regularization for Addressing Causal Confusion in Imitation Learning

Jongjin Park, Younggyo Seo|arXiv (Cornell University)|Oct 26, 2021
Reinforcement Learning in Robotics参考文献 56被引用 5
一句话总结

本文提出了一种名为 OREO(Object-aware Regularization)的方法,通过鼓励策略对语义对象进行均匀注意力,从而减轻由虚假相关性引起的因果混淆,提升模仿学习中的行为克隆性能。通过使用 VQ-VAE 识别对象级别的离散编码,并在训练过程中随机遮蔽整个语义对象,OREO 显著提升了泛化能力,在 Atari 和 CARLA 环境中均优于以往的正则化方法和基于因果性的方法,甚至在仅依赖少量环境交互的情况下,性能也超越了需要大量环境交互的逆向强化学习方法。

ABSTRACT

Behavioral cloning has proven to be effective for learning sequential decision-making policies from expert demonstrations. However, behavioral cloning often suffers from the causal confusion problem where a policy relies on the noticeable effect of expert actions due to the strong correlation but not the cause we desire. This paper presents Object-aware REgularizatiOn (OREO), a simple technique that regularizes an imitation policy in an object-aware manner. Our main idea is to encourage a policy to uniformly attend to all semantic objects, in order to prevent the policy from exploiting nuisance variables strongly correlated with expert actions. To this end, we introduce a two-stage approach: (a) we extract semantic objects from images by utilizing discrete codes from a vector-quantized variational autoencoder, and (b) we randomly drop the units that share the same discrete code together, i.e., masking out semantic objects. Our experiments demonstrate that OREO significantly improves the performance of behavioral cloning, outperforming various other regularization and causality-based methods on a variety of Atari environments and a self-driving CARLA environment. We also show that our method even outperforms inverse reinforcement learning methods trained with a considerable amount of environment interaction.

研究动机与目标

  • 为解决行为克隆中的因果混淆问题,即策略利用虚假相关性(如 Atari 游戏中的得分)而非学习真正的因果决策规则。
  • 开发一种正则化方法,促使策略对所有语义对象进行均匀注意力,防止对干扰变量的过度依赖。
  • 在无需昂贵环境交互的前提下实现稳健的模仿学习性能,与需要交互的逆向强化学习或交互式因果发现方法形成对比。
  • 证明通过语义遮蔽实现的物体感知正则化可带来在混淆环境中的更优泛化能力和性能表现。

提出的方法

  • 使用向量量化变分自编码器(VQ-VAE)从图像特征中提取离散编码,将语义相似的空间单元(如背景、得分)归为同一编码。
  • 将语义对象定义为共享相同 VQ-VAE 离散编码的特征图单元集合。
  • 在训练过程中应用随机遮蔽,即丢弃与同一离散编码相关联的所有单元,从而实现对整个语义对象的遮蔽。
  • 对策略进行正则化,使其对特定语义对象的存在或缺失保持不变,促进均匀注意力,减少对虚假线索的依赖。
  • 使用遮蔽后的图像作为输入,端到端训练策略,采用标准行为克隆优化方法。
  • 在所有环境中使用相同的 VQ-VAE 编码器,实现一致的语义对象提取,无需针对特定任务重新训练。

实验结果

研究问题

  • RQ1通过鼓励对语义对象的均匀注意力,物体感知正则化是否能减少行为克隆中的因果混淆?
  • RQ2通过 VQ-VAE 编码对整个语义对象进行遮蔽,是否能提升在混淆环境中的策略泛化能力?
  • RQ3该方法是否能在不依赖环境交互的情况下,超越现有的正则化方法和基于因果性的方法?
  • RQ4OREO 与依赖大量环境交互的逆向强化学习方法相比表现如何?

主要发现

  • 在混淆的 Atari 环境中,OREO 显著提升了行为克隆性能,17 款游戏的中位人类归一化得分(HNS)从 46.7% 提升至 53.6%。
  • 在 CARLA 自动驾驶环境中,OREO 的表现优于标准行为克隆和其他正则化技术。
  • OREO 超过了基于因果性的方法(如 de Haan 等人提出的方法),后者需要交互式专家查询或环境反馈。
  • 平均而言,OREO 在 Atari 游戏中实现了 114.9% 的 HNS,超过次优方法(91.7%),展现出强大的泛化能力。
  • 在 Pong 环境中,OREO 训练的策略在遮蔽得分的图像上仍能获得 12.5 ± 0.7 的奖励,而标准 BC 策略则失败(3.1 ± 1.4 奖励),证实其对虚假线索的依赖显著降低。
  • OREO 即使在仅依赖少量环境交互的设置下,也超越了需要大量环境交互训练的逆向强化学习方法,表明其在低数据、无交互场景下的高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。