Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Sim-to-Real Adaptation for Visual Robotic Manipulation

Rae Jeong, Yusuf Aytar|arXiv (Cornell University)|Oct 21, 2019
Domain Adaptation and Few-Shot Learning参考文献 42被引用数 9
ひとこと要約

本論文は、ラベルなし現実世界データを用いた視覚的ロボット操作のための自己教師付きシミュレーションから現実への適応手法を提案する。時間的対照学習とダイナミクスモデリングを統合した順序ベースの自己教師付き損失、すなわち対照的前向きダイナミクス(CFD)損失を活用することで、シミュレーションから現実への状態表現の転送を向上させ、わずか5時間のラベルなし現実データでの実世界でのキューブ積み上げタスクで62%の成功を達成した。これはドメインランダマイゼーションやドメイン adversarial 法よりも優れている。

ABSTRACT

Collecting and automatically obtaining reward signals from real robotic visual data for the purposes of training reinforcement learning algorithms can be quite challenging and time-consuming. Methods for utilizing unlabeled data can have a huge potential to further accelerate robotic learning. We consider here the problem of performing manipulation tasks from pixels. In such tasks, choosing an appropriate state representation is crucial for planning and control. This is even more relevant with real images where noise, occlusions and resolution affect the accuracy and reliability of state estimation. In this work, we learn a latent state representation implicitly with deep reinforcement learning in simulation, and then adapt it to the real domain using unlabeled real robot data. We propose to do so by optimizing sequence-based self supervised objectives. These exploit the temporal nature of robot experience, and can be common in both the simulated and real domains, without assuming any alignment of underlying states in simulated and unlabeled real images. We propose Contrastive Forward Dynamics loss, which combines dynamics model learning with time-contrastive techniques. The learned state representation that results from our methods can be used to robustly solve a manipulation task in simulation and to successfully transfer the learned skill on a real system. We demonstrate the effectiveness of our approaches by training a vision-based reinforcement learning agent for cube stacking. Agents trained with our method, using only 5 hours of unlabeled real robot data for adaptation, shows a clear improvement over domain randomization, and standard visual domain adaptation techniques for sim-to-real transfer.

研究の動機と目的

  • シミュレーションで訓練された視覚ベースの強化学習エージェントが現実のロボットに展開された際に、現実とシミュレーションのギャップにより一般化性能が著しく低下するという課題に対処すること。
  • シミュレーションと現実の間のペアリングやアライメントデータを必要とせず、ラベルなし現実世界ロボットデータを活用してシミュレーションから現実への転送を改善すること。
  • シミュレーションおよび現実の両環境におけるロボット経験の時間的構造を活用する自己教師付き表現学習手法を開発すること。
  • 現実世界のノイズ、遮蔽、解像度の変動にさらされる長時間スケールの操作タスク(例:キューブ積み上げ)において、状態表現のロバスト性を高めること。

提案手法

  • 2段階の訓練手順を採用:まず合成画像とプロ prioception を用いてシミュレーションでビジョンベースのポリシーを事前学習し、次にラベルなし現実ロボットデータを用いて状態表現を適応させる。
  • 適応フェーズでは、時間的整合性と前向きダイナミクス予測を同時に最適化する順序ベースの自己教師付き目的、具体的には対照的前向きダイナミクス(CFD)損失を用いる。
  • CFD損失は、観測・行動の順序ペアの正例と負例を比較し、意味的に類似した順序が潜在空間で近くなるようにネットワークの表現を学習させる。
  • 強化学習の目的関数、状態ベースエージェントを模倣するための行動クラッシング(BC)目的関数、自己教師付きCFD損失を同時に最適化することで、安定的かつ効率的な訓練を可能にする。
  • 状態ベースエージェントとビジョンベースエージェント間の共有リプレイバッファが知識移転を促進し、サンプル効率と訓練安定性を向上させる。
  • 適応段階で、シミュレーションと現実データの両方で効果的なエンコーダー共有を実現するためのモダリティチューニングを用いることで、深刻な忘却を回避する。

実験結果

リサーチクエスチョン

  • RQ1ペアリングやアライメントデータが不要な状況下で、順序ベースの自己教師付き学習が視覚的ロボット操作におけるシミュレーションから現実への転送を改善できるか?
  • RQ2前向きダイナミクスモデリングと時間的対照学習を組み合わせることで、現実世界のロボットデータにおける状態表現学習がどのように向上するか?
  • RQ3強化学習、行動クラッシング、自己教師付き目的を同時に最適化することが、ポリシー性能と訓練安定性に与える影響は何か?
  • RQ4エンドツーエンドの自己教師付き適応は、モダリティチューニングを用いた2段階訓練手順を上回る性能を発揮するか?
  • RQ5ラベルなし現実世界データを用いることで、視覚ベースのロボット制御においてドメインランダマイゼーションや敵対的ドメイン適応の必要性をどの程度軽減できるか?

主な発見

  • CFD目的関数を用いた2段階の自己教師付き適応により、実世界でのキューブ積み上げタスクで62%のタスク成功を達成し、ドメインランダマイゼーションやドメイン敵対的ニューラルネットワーク(DANN)を著しく上回った。
  • TCN損失を用いたエンドツーエンドの自己教師付き適応では、エンコーダー共有が不十分であったため性能が低下した。これは、2段階訓練プロセスにおけるモダリティチューニングの重要性を示している。
  • 強化学習目的、行動クラッシング、自己教師付きCFD損失の3つを同時に最適化することが不可欠であった。自己教師付き損失のみを最適化した場合、深刻な忘却が発生し、タスク性能が崩壊した。
  • 状態ベースエージェントとビジョンベースエージェント間の共有リプレイバッファの使用により、特に複雑な長時間スケールタスクにおいて訓練速度と安定性が向上した。
  • ビジョンベースエージェントに行動クラッシング目的を追加することで、自己教師付き目的と同時に訓練しても学習が著しく加速し、性能の維持が可能になった。
  • アブレーションスタディの結果、時間的構造とアクション条件付きダイナミクスを両方活用するCFD損失が、TCN や DANN といった単純な自己教師付き目的よりも本タスクにおいてより効果的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。