Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning with Videos: Combining Offline Observations with Interaction

Karl Schmeckpeper, Oleh Rybkin|arXiv (Cornell University)|Nov 12, 2020
Reinforcement Learning in Robotics被引用数 16
ひとこと要約

本稿では、視覚ベースのロボット政策学習におけるサンプル効率を向上させるために、オフラインのヒューマンビデオとオンラインのロボットインタラクションを組み合わせるフレームワークである強化学習によるビデオ(RLV)を提案する。ドメイン不変表現を用いて視覚的観察からアクションと報酬を推定することで、標準的な強化学習と比較して、不完全なアクションおよび報酬推定のもとでも、サンプル複雑性を50%以上低減する。

ABSTRACT

Reinforcement learning is a powerful framework for robots to acquire skills from experience, but often requires a substantial amount of online data collection. As a result, it is difficult to collect sufficiently diverse experiences that are needed for robots to generalize broadly. Videos of humans, on the other hand, are a readily available source of broad and interesting experiences. In this paper, we consider the question: can we perform reinforcement learning directly on experience collected by humans? This problem is particularly difficult, as such videos are not annotated with actions and exhibit substantial visual domain shift relative to the robot's embodiment. To address these challenges, we propose a framework for reinforcement learning with videos (RLV). RLV learns a policy and value function using experience collected by humans in combination with data collected by robots. In our experiments, we find that RLV is able to leverage such videos to learn challenging vision-based skills with less than half as many samples as RL methods that learn from scratch.

研究の動機と目的

  • 視覚ベースのロボット操作タスクにおける強化学習(RL)のサンプル非効率性の課題に対処すること。
  • アノテーションのないヒューマンビデオを用いて、模倣学習の限界を超えて、RLがエキスパートのデモンストレーションを上回る性能を達成できることを可能にすること。
  • ヒューマンとロボットの視覚的観察の間で顕著なドメインシフトが生じる中で、構造のない、アクションを伴わないヒューマンビデオを深層強化学習パイプラインに統合すること。
  • 真のアクションや報酬アノテーションが存在しない状況でも、エンドツーエンドの学習を可能にするために、視覚データからアクションと報酬を推定する手法を開発すること。
  • オフラインのヒューマンビデオとオンラインのインタラクションを組み合わせることで、標準的なRLや模倣学習のみの手法よりも高速に収束し、より優れた最終的性能が得られることを実証すること。

提案手法

  • ドメイン不変表現ネットワークを用いて、ヒューマンビデオとロボットインタラクションデータの視覚的特徴を統合し、ドメインシフトを低減する。
  • 逆運動学モデルを訓練して、ヒューマンビデオデータの観察シーケンスからアクションを推定し、真のアクションが存在しない状況でもポリシー学習を可能にする。
  • 対照的表現学習を用いて報酬予測器を学習し、明示的な報酬信号が存在しない状況でも、観察シーケンスからスパarsな報酬を推定する。
  • 実際のロボットインタラクションデータと共に、推定されたアクションと報酬をリプレイバッファに統合し、標準的な強化学習アルゴリズム(例:SAC)で共同学習を行う。
  • 特徴の質とドメイン間の一般化性を向上させるために、自己教師付き対照的学習の目的関数を適用する。
  • 実データと推定データの組み合わせたリプレイバッファ上で、標準的なオフポリシー強化学習アルゴリズム(例:SAC)を用いてポリシーと価値関数をファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1アクションや報酬がアノテーションされていない未加工のヒューマンビデオを、ロボットポリシーの学習に有効に活用できるか?
  • RQ2ヒューマンビデオから推定されたアクションと報酬は、標準的な強化学習と比較して、視覚ベースの強化学習におけるサンプル効率をどの程度向上させられるか?
  • RQ3ヒューマンとロボットの視覚的観察の間のドメインシフトや、不完全なアクション/報酬予測に対して、本手法はどの程度頑健か?
  • RQ4学習速度と最終的性能の両面で、本フレームワークは標準的な強化学習と観察からの模倣学習を上回ることができるか?
  • RQ5本手法は、多様で複雑な視覚的行動を含む実世界のヒューマンビデオにも一般化可能か?

主な発見

  • RLVは、標準的なSACベースの強化学習と比較して、同じ性能水準に到達するためのオンラインインタラクションサンプル数を50%以上削減する。
  • 推定アクションや報酬がゼロであっても、本手法は標準的な強化学習よりも速く収束するため、劣化した監視信号に対しても頑健であることが示された。
  • 真のアクションや報酬を使用した場合と同等の性能を達成しており、推定された監視信号の質の高さを示している。
  • RLVは、学習速度と最終的性能の両面で、最先端の探索ベースライン(RND)を上回っており、ビデオデータの価値が探索を超えたものであることを示している。
  • 本フレームワークは実世界のヒューマンビデオにも一般化でき、プッシュやドア開閉といった複雑な視覚ベースの操作タスクを成功裏に学習した。
  • アブレーションスタディにより、不完全なアクションおよび報酬予測に対しても本手法が頑健であることが確認され、学習済みラベルを真のラベルに置き換えた場合の性能低下は最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。