Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning with Videos: Combining Offline Observations with Interaction

Karl Schmeckpeper, Oleh Rybkin|arXiv (Cornell University)|Nov 12, 2020
Reinforcement Learning in Robotics被引用 16
一句话总结

本文提出强化学习视频(RLV)框架,结合离线人类视频与在线机器人交互,提升视觉感知机器人策略学习的样本效率。通过利用领域不变表示从视觉观测中推断动作与奖励,RLV 相较于标准强化学习,将样本复杂度降低超过50%,即使动作与奖励估计不准确亦成立。

ABSTRACT

Reinforcement learning is a powerful framework for robots to acquire skills from experience, but often requires a substantial amount of online data collection. As a result, it is difficult to collect sufficiently diverse experiences that are needed for robots to generalize broadly. Videos of humans, on the other hand, are a readily available source of broad and interesting experiences. In this paper, we consider the question: can we perform reinforcement learning directly on experience collected by humans? This problem is particularly difficult, as such videos are not annotated with actions and exhibit substantial visual domain shift relative to the robot's embodiment. To address these challenges, we propose a framework for reinforcement learning with videos (RLV). RLV learns a policy and value function using experience collected by humans in combination with data collected by robots. In our experiments, we find that RLV is able to leverage such videos to learn challenging vision-based skills with less than half as many samples as RL methods that learn from scratch.

研究动机与目标

  • 解决视觉感知机器人操作任务中强化学习(RL)样本效率低下的挑战。
  • 通过利用未标注的人类视频,使强化学习超越专家示范的局限,克服模仿学习的不足。
  • 在人类与机器人视觉观测之间存在显著领域偏移的前提下,将非结构化、无动作的人类视频整合进深度强化学习流程。
  • 开发一种方法,从视觉数据中推断动作与奖励,实现无需真实动作或奖励标注的端到端训练。
  • 证明结合离线人类视频与在线交互,可实现比标准强化学习或仅模仿学习更快的收敛速度与更优的最终性能。

提出的方法

  • 使用领域不变表示网络对齐来自人类视频与机器人交互数据的视觉特征,降低领域偏移影响。
  • 训练逆动力学模型,从人类视频数据的观测序列中推断动作,实现无需真实动作标注的策略学习。
  • 利用对比表示学习方法学习奖励预测器,即使缺乏显式奖励信号,也能从观测序列中估计稀疏奖励。
  • 将推断出的动作与奖励与真实机器人交互数据一并存入经验回放缓冲区,用于标准强化学习算法(如SAC)的联合训练。
  • 应用自监督对比学习目标,提升特征质量与跨领域泛化能力。
  • 使用标准的离策略强化学习算法(如SAC)对策略与价值函数进行微调,训练数据来自真实与推断数据的联合经验回放缓冲区。

实验结果

研究问题

  • RQ1强化学习能否有效利用未标注的人类视频(无动作或奖励)作为训练机器人策略的数据源?
  • RQ2从人类视频中推断出的动作与奖励,在视觉强化学习中相比标准强化学习,能在多大程度上提升样本效率?
  • RQ3所提出方法对人类与机器人视觉观测之间的领域偏移以及不准确的动作/奖励预测,具有多强的鲁棒性?
  • RQ4该框架能否在学习速度与最终性能上均优于标准强化学习与仅基于观测的模仿学习?
  • RQ5该方法是否能泛化至真实世界的人类视频,包括多样且复杂的视觉行为?

主要发现

  • RLV 相较于基于SAC的标准强化学习,将达到特定性能水平所需的在线交互样本数减少超过50%。
  • 即使在零推断动作或奖励的情况下,该方法仍比标准强化学习收敛更快,表明其对弱监督具有强鲁棒性。
  • 该方法性能可与使用真实动作与奖励时相媲美,表明推断监督的质量较高。
  • RLV 在学习速度与最终性能上均优于最先进的探索基线方法(RND),表明视频数据的价值超越探索本身。
  • 该框架可泛化至真实人类视频,成功学习复杂视觉感知操作任务,如推动物体与打开抽屉。
  • 消融实验表明,该方法对不准确的动作与奖励预测具有鲁棒性,当使用学习得到的标签而非真实标签时,性能下降可忽略不计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。