Skip to main content
QUICK REVIEW

[论文解读] SECANT: Self-Expert Cloning for Zero-Shot Generalization of Visual Policies

Linxi Fan, Guanzhi Wang|arXiv (Cornell University)|Jun 17, 2021
Multimodal Machine Learning Applications参考文献 70被引用 14
一句话总结

Secant 提出了一种两阶段自专家克隆框架,首先通过弱增强的强化学习训练策略,然后将该策略蒸馏到使用强增强训练的学生网络中,以学习鲁棒的视觉表征。该方法在四个视觉强化学习领域实现了最先进(SOTA)的零样本泛化性能,平均奖励提升分别为 26.5%(DMControl)、337.8%(机器人操控)、47.7%(自动驾驶)和 15.8%(室内导航)。

ABSTRACT

Generalization has been a long-standing challenge for reinforcement learning (RL). Visual RL, in particular, can be easily distracted by irrelevant factors in high-dimensional observation space. In this work, we consider robust policy learning which targets zero-shot generalization to unseen visual environments with large distributional shift. We propose SECANT, a novel self-expert cloning technique that leverages image augmentation in two stages to decouple robust representation learning from policy optimization. Specifically, an expert policy is first trained by RL from scratch with weak augmentations. A student network then learns to mimic the expert policy by supervised learning with strong augmentations, making its representation more robust against visual variations compared to the expert. Extensive experiments demonstrate that SECANT significantly advances the state of the art in zero-shot generalization across 4 challenging domains. Our average reward improvements over prior SOTAs are: DeepMind Control (+26.5%), robotic manipulation (+337.8%), vision-based autonomous driving (+47.7%), and indoor object navigation (+15.8%). Code release and video are available at https://linxifan.github.io/secant-site/.

研究动机与目标

  • 解决在大规模视觉分布偏移下视觉强化学习中的零样本泛化挑战。
  • 通过将策略优化与表征鲁棒性解耦,克服强化学习中鲁棒表征学习与训练稳定性之间的权衡。
  • 开发一种方法,在无需测试时适应或奖励信号的情况下泛化到未见过的视觉环境。
  • 在包括机器人、自动驾驶和导航在内的多样化、真实视觉领域中展示优越性能。

提出的方法

  • 仅使用原始环境中的弱增强(例如随机裁剪)通过强化学习训练专家策略。
  • 通过监督学习训练学生网络以模仿专家的行为,但对输入观测应用强增强(例如 Cutout、Mixup、Cutmix、高斯噪声)。
  • 通过在第一阶段进行强化学习、第二阶段进行监督模仿,实现策略学习与鲁棒表征学习的解耦。
  • 在学生训练期间使用相同的专家策略提供真实动作,确保在视觉退化情况下策略性能得以保持。
  • 在学生训练中应用强增强,以鼓励对无关视觉变化的不变性,从而提升零样本泛化能力。
  • 通过在训练期间不暴露专家或学生于测试环境,并避免任何测试时适应,确保方法严格为零样本。

实验结果

研究问题

  • RQ1一种将策略优化与鲁棒表征学习解耦的两阶段方法,能否提升视觉强化学习中的零样本泛化?
  • RQ2在模仿学习而非强化学习训练中应用强数据增强(如 Cutmix 和 Mixup)的效果如何?
  • RQ3在存在大规模视觉分布偏移的领域中,使用强增强的自专家克隆方法在多大程度上优于先前的 SOTA 方法?
  • RQ4与基线方法相比,所提出方法是否学习到更任务相关且更鲁棒的视觉表征,如通过循环一致性与显著性图所衡量?
  • RQ5Secant 的推理速度与需要基于梯度的测试时适应方法(如 PAD)相比如何?

主要发现

  • 在零样本泛化设置下,Secant 在 DeepMind Control Suite 上相比先前 SOTA 方法平均奖励提升 26.5%。
  • 在机器人操控任务中,Secant 相较于先前最先进方法性能提升 337.8%。
  • 在 CARLA 中基于视觉的自动驾驶任务中,Secant 使智能体在多样天气与光照条件下行驶距离比先前 SOTA 方法远 47.7%。
  • 在 iGibson 的室内导航任务中,Secant 在未见过的房间(具有新颖纹理与布局)中成功率比之前方法高 15.8%。
  • 由于其推理高效且无需梯度计算的架构,Secant 在 CPU 上比 PAD 快 65 倍,在 GPU 上快 42 倍。
  • 显著性图与循环一致性分析表明,Secant 学习到的视觉表征比基线方法更具鲁棒性与任务相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。