[論文レビュー] XIRL: Cross-embodiment Inverse Reinforcement Learning
XIRLは、時間的サイクル整合性を用いて第三人称視線のデモ動画から身体的特徴に依存しない視覚表現を自己教師付きで学習する逆強化学習手法を提案する。これにより、多様なロボットの身体的特徴にわたる堅牢で高密度な報酬関数が得られ、さまざまなロボットの身体的特徴に対してポリシーの学習が可能になる。本手法は、シミュレート環境および現実世界のベンチマークにおいて、先行手法を上回る高いサンプル効率と、未観測のエージェントへのゼロショット一般化性能を達成する。
We investigate the visual cross-embodiment imitation setting, in which agents learn policies from videos of other agents (such as humans) demonstrating the same task, but with stark differences in their embodiments -- shape, actions, end-effector dynamics, etc. In this work, we demonstrate that it is possible to automatically discover and learn vision-based reward functions from cross-embodiment demonstration videos that are robust to these differences. Specifically, we present a self-supervised method for Cross-embodiment Inverse Reinforcement Learning (XIRL) that leverages temporal cycle-consistency constraints to learn deep visual embeddings that capture task progression from offline videos of demonstrations across multiple expert agents, each performing the same task differently due to embodiment differences. Prior to our work, producing rewards from self-supervised embeddings typically required alignment with a reference trajectory, which may be difficult to acquire under stark embodiment differences. We show empirically that if the embeddings are aware of task progress, simply taking the negative distance between the current state and goal state in the learned embedding space is useful as a reward for training policies with reinforcement learning. We find our learned reward function not only works for embodiments seen during training, but also generalizes to entirely new embodiments. Additionally, when transferring real-world human demonstrations to a simulated robot, we find that XIRL is more sample efficient than current best methods. Qualitative results, code, and datasets are available at https://x-irl.github.io
研究の動機と目的
- 異なる身体的特徴を持つエキスパートの第三人称視線の動画からポリシーを学ぶ挑戦に取り組むこと。行動ラベルが利用できないこと。
- 身体的特徴のギャップ(例:人間の手 vs. ロボットアーム)に起因する、多様なエージェント間の軌道の整合性を克服すること。
- ペアリングのないデモ動画から、ラベルなしの自己教師付き手法を用いて、高密度でタスク進行状況に敏感な報酬関数を学習すること。
- 事前学習済みの視覚埋め込みのみを用いて、新しい未観測のロボットの身体的特徴にポリシーをゼロショットで転送できること。
- クロスエージェント模倣学習手法を評価するためのベンチマークと現実世界のデータセットを構築すること。
提案手法
- 身体的特徴の違いに対して不変な視覚埋め込みを学習するため、時間的サイクル整合性(TCC)を用いてビジョンエンコーダーを訓練する。
- 訓練済みのエンコーダーを用いて、動画フレームをタスク進行状況が保持された共有埋め込み空間にマップする。
- 学習済み埋め込み空間内での現在状態とゴール状態のL2距離の負の値を、高密度な報酬関数として定義する。
- 真の行動ラベルや軌道の整合性を必要とせず、自己教師付き報酬を用いて下流の強化学習ポリシーを訓練する。
- 形状が異なるシミュレーテッドエージェントおよび、実際の人間のデモをシミュレーテッドロボットに変換する応用に本手法を適用する。
- データオーグメンテーション(色のジャイタ、ランダムクロップ、グレースケール、ぼかし)と対照的学習目的を用いて、埋め込みの質を向上させる。
実験結果
リサーチクエスチョン
- RQ1多様なエキスパートのデモから学習した自己教師付きの視覚表現は、身体的特徴の違いに依存せず、タスク進行状況を捉えられるか?
- RQ2そのような表現を用いて、未観測のロボットの身体的特徴に跨る下流の強化学習に一般化可能な高密度な報酬関数を定義できるか?
- RQ3XIRLは、クロスエージェント設定において、先行する模倣学習および逆強化学習手法と比較して、サンプル効率と最終的なパフォーマンスで優れているか?
- RQ4実際の人間のデモで学習した報酬関数は、異なる身体的特徴を持つシミュレーテッドロボットにどの程度転送可能か?
- RQ5TCC損失とマルチエージェント事前学習が、ゼロショット一般化を可能にするにあたり、どのようなインダクティブバイアスを果たしているか?
主な発見
- XIRLは、真の行動アノテーションがなくても、タスク進行状況を保持する視覚埋め込みを学習し、効果的な高密度報酬設計を可能にする。
- 学習済み埋め込み空間内での現在状態とゴール状態のL2距離の負の値は、RLに非常に効果的で一般化可能な報酬関数である。
- ベースライン手法と比較して、XIRLは優れたサンプル効率を達成しており、一部のエージェントでは真のスパarsな報酬よりも早く学習を達成している。
- 本手法は、トレーニング中に見られなかった新しいロボットの身体的特徴に対してもゼロショットで一般化可能であり、人間の動画からSawyerロボットへの現実世界での転送にも成功している。
- X-MAGICALベンチマークにおいて、XIRLは4種類の異なるシミュレーテッドエージェントに対して、ベースラインの模倣学習および逆RL手法を顕著に上回っている。
- t-SNE可視化の定性的な結果から、XIRLの埋め込みは異なるエキスパートからの軌道を整合させ、ゴールまでの距離と実際のタスク進行状況の相関を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。