Skip to main content
QUICK REVIEW

[論文レビュー] Model-Based Visual Planning with Self-Supervised Functional Distances

Stephen Tian, Suraj Nair|arXiv (Cornell University)|Dec 30, 2020
Artificial Intelligence in Games参考文献 58被引用数 17
ひとこと要約

本稿では、オフラインでラベルなしのデータから動的距離関数と視覚的ダイナミクスモデルを学習する自己教師付き手法MBOLDを提案する。短時間予測計画と学習済みQ関数に基づく距離メトリックを組み合わせることで、ゴール到達タスクにおいて優れた性能を発揮し、シミュレーションおよび現実世界の操作タスク(物体の押し出しや引き出し開閉を含む)において、モデルフリーおよびモデルベースのベースラインを上回る結果を得た。

ABSTRACT

A generalist robot must be able to complete a variety of tasks in its environment. One appealing way to specify each task is in terms of a goal observation. However, learning goal-reaching policies with reinforcement learning remains a challenging problem, particularly when hand-engineered reward functions are not available. Learned dynamics models are a promising approach for learning about the environment without rewards or task-directed data, but planning to reach goals with such a model requires a notion of functional similarity between observations and goal states. We present a self-supervised method for model-based visual goal reaching, which uses both a visual dynamics model as well as a dynamical distance function learned using model-free reinforcement learning. Our approach learns entirely using offline, unlabeled data, making it practical to scale to large and diverse datasets. In our experiments, we find that our method can successfully learn models that perform a variety of tasks at test-time, moving objects amid distractors with a simulated robotic arm and even learning to open and close a drawer using a real-world robot. In comparisons, we find that this approach substantially outperforms both model-free and model-based prior methods. Videos and visualizations are available here: http://sites.google.com/berkeley.edu/mbold.

研究の動機と目的

  • 報酬ラベルなしの大量かつ多様なラベルなしデータセットから汎用的なロボット学習を可能にすること。
  • オフラインで入手可能なタスクに依存しないデータのみが利用可能な状況において、視覚的ゴールへの計画を実現すること。
  • 視覚的外観だけでなく機能的類似性を反映する動的距離関数を学習すること。
  • 予測可能な視覚的ダイナミクスモデルと学習済み距離関数を組み合わせ、効果的な長時間計画を実現すること。
  • オンラインファインチューニングなしで、オフラインデータのみを用いて視覚的ゴール到達を現実世界のロボットシステムにスケーリングすること。

提案手法

  • オフラインでラベルなしの画像シーケンスから視覚的ダイナミクスモデルを学習し、将来の状態を予測する。
  • Q学習風のベルマン更新を用いた近似的な動的プログラミングにより、同じオフラインデータから動的距離関数を学習する。
  • 距離関数は、最適方策が任意の状態からゴールに到達するために必要なステップ数を推定し、環境のダイナミクスを組み込む。
  • ダイナミクスモデルを用いて短時間予測のロールアウトを実行し、学習済み距離関数をグローバルコスト関数として組み合わせることで視覚的モデル予測制御を実施する。
  • 訓練中にネガティブな遷移マイニングを実施し、特に干渉要因を含む複雑なシーンにおいて距離の一般化性能を向上させる。
  • 報酬信号や人間による監督なしに、オフラインデータを用いて距離関数をエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1ロボットはオフラインでラベルなしのデータのみを用いて、任意の視覚的ゴールに到達できるか?
  • RQ2報酬信号やタスク固有の監督なしに、状態間の機能的類似性をどのように測定できるか?
  • RQ3視覚的ダイナミクスモデルと学習済み動的距離関数を組み合わせることで、視覚的制御タスクにおける長時間計画性能が向上するか?
  • RQ4ヒューリスティックなメトリック(ピクセル単位のL2距離やVAEの潜在空間距離)と比較して、自己教師付き距離学習はどのように優れているか?
  • RQ5この手法は、オンラインファインチューニングなしで現実世界のロボット操作タスクに一般化可能か?

主な発見

  • 1オブジェクト押し出しタスクにおいて、MBOLDは55.2% ± 4.3%の成功率を達成し、モデルフリーのQ関数ベースのベースライン(19.2% ± 3.6%)を顕著に上回った。
  • 3オブジェクト押し出しタスクでは、MBOLDが44.8% ± 2.9%の成功率を達成し、モデルフリーのベースライン(15.6% ± 3.6%)を上回った。
  • 到達タスクでは、MBOLDが94.4% ± 3.3%の成功率を達成し、モデルフリーのベースライン(31.8% ± 5.2%)を大きく上回った。
  • Q関数に基づく距離メトリックは、すべての物体押し出しタスクにおいてVAEの潜在空間距離と直接的な時間的距離回帰の両方を上回った。
  • ネガティブな遷移マイニングは、特に困難なタスクにおいて顕著に性能を向上させ、視覚的に目立つ特徴(例:ロボットアーム)に過剰に依存するのを防いだ。
  • 本手法は、オンラインファインチューニングなしに現実世界の引き出し操作タスクへも成功して転送され、同じベンチマークでVisual Foresightを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。