Skip to main content
QUICK REVIEW

[论文解读] Playing hard exploration games by watching YouTube

Yusuf Aytar, Tobias Pfaff|arXiv (Cornell University)|May 29, 2018
Reinforcement Learning in Robotics被引用 6
一句话总结

该论文提出了一种自监督方法,使深度强化学习智能体能够通过观看未对齐、嘈杂的YouTube视频,在无动作或奖励轨迹的情况下掌握困难探索的Atari游戏——《蒙特祖玛的复仇》、《陷阱》和《私人侦探》。通过利用时间对比学习和跨模态对比学习学习领域不变的视频表征,智能体使用单个嵌入的YouTube片段生成模仿奖励,首次在无环境奖励的情况下实现人类水平性能。

ABSTRACT

Deep reinforcement learning methods traditionally struggle with tasks where environment rewards are particularly sparse. One successful method of guiding exploration in these domains is to imitate trajectories provided by a human demonstrator. However, these demonstrations are typically collected under artificial conditions, i.e. with access to the agent's exact environment setup and the demonstrator's action and reward trajectories. Here we propose a two-stage method that overcomes these limitations by relying on noisy, unaligned footage without access to such data. First, we learn to map unaligned videos from multiple sources to a common representation using self-supervised objectives constructed over both time and modality (i.e. vision and sound). Second, we embed a single YouTube video in this representation to construct a reward function that encourages an agent to imitate human gameplay. This method of one-shot imitation allows our agent to convincingly exceed human-level performance on the infamously hard exploration games Montezuma's Revenge, Pitfall! and Private Eye for the first time, even if the agent is not presented with any environment rewards.

研究动机与目标

  • 使强化学习智能体能够在稀疏奖励的困难探索Atari游戏中取得成功,传统方法因动作空间呈指数级增长且缺乏奖励信号而失效。
  • 克服智能体观测与未对齐、嘈杂的YouTube游戏视频之间的领域差异,这些差异通常会阻碍模仿学习。
  • 开发一种自监督表征学习方法,实现对多样化视频演示的对齐,而无需帧级对齐或动作/奖励标注。
  • 通过构建鼓励模仿人类游戏轨迹的奖励函数,实现在单个YouTube视频上的零样本模仿。
  • 在不依赖环境奖励或专家动作序列的情况下,实现在《蒙特祖玛的复仇》、《陷阱》和《私人侦探》等著名困难Atari游戏中的人类水平或超人类水平表现。

提出的方法

  • 该方法使用自监督对比学习框架,通过时间对比学习(TDC)和跨模态对比学习(CMC)两种目标,从多个未对齐的YouTube视频中学习共享的视频表征。
  • TDC对来自同一视频中时间上接近的片段进行对齐,而CMC则对来自不同视频中对应游戏时刻的视觉与音频片段进行对齐。
  • 由此产生的共享嵌入空间可支持循环一致性评估,以在无真实标注的情况下评估对齐质量。
  • 将单个YouTube视频嵌入该空间,以生成一系列探索检查点,用于定义智能体的辅助模仿奖励。
  • 智能体结合标准强化学习(IMPALA)使用该模仿奖励来引导探索,即使在无环境奖励的情况下亦可实现。
  • 该方法无需访问演示者动作序列或奖励轨迹,因此可适用于真实世界中未经筛选的视频数据。

实验结果

研究问题

  • RQ1自监督表征学习能否将未对齐、嘈杂的YouTube视频对齐到一个共享空间,以捕捉有意义的时间结构和跨模态结构?
  • RQ2单个嵌入的YouTube视频能否生成可靠的模仿奖励,使智能体在无环境奖励的情况下解决困难探索游戏?
  • RQ3该方法是否能在显著的领域差异下泛化,例如智能体环境与YouTube画面之间在分辨率、色彩、画面比例和视觉伪影方面的差异?
  • RQ4智能体能否仅使用YouTube视频且不依赖专家动作或奖励数据,在《蒙特祖玛的复仇》、《陷阱》和《私人侦探》中实现人类水平或超人类水平表现?
  • RQ5性能是否对专家视频的变化具有鲁棒性,包括高领域偏移和缺乏对齐的情况?

主要发现

  • 该方法在《蒙特祖玛的复仇》中取得37,232.7分,超过人类平均分4,743.0分,也高于DQfD方法的SOTA记录4,659.7分。
  • 在《陷阱》中,智能体得分为54,912.4分,超过人类平均分6,464.0分,也高于DQfD方法的SOTA记录57.3分。
  • 在《私人侦探》中,智能体得分为98,212.5分,超过人类平均分69,571.0分,也高于DQfD方法的SOTA记录42,457.2分。
  • 即使仅使用模仿奖励进行训练,智能体在所有三款游戏中均实现了超人类水平表现,且未使用任何环境奖励信号。
  • 在不同专家视频上性能表现稳定,包括高领域偏移的视频,表明该方法具备良好的泛化能力。
  • TDC与CMC自监督目标的结合,有效对齐了未对齐的YouTube视频,为复杂环境中实现零样本模仿学习奠定了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。