Skip to main content
QUICK REVIEW

[論文レビュー] Time Reversal as Self-Supervision

Suraj Nair, Mohammad Babaeizadeh|arXiv (Cornell University)|Oct 2, 2018
Robot Manipulation and Learning参考文献 41被引用数 13
ひとこと要約

本論文は、目的状態から軌道を逆方向に予測する時間反転モデル(TRM)を学習することで、教師ありデータや特権情報なしに目的指向のポリシー学習を可能にする自己教師付き手法TRASS(Time Reversal as Self-Supervision)を提案する。視覚的モデル予測制御を用いて、真実の状態情報なしにRGB入力のみで、実世界のテトリスブロック結合タスクにおいて、既視のブロックペアで75%、未視のペアで50%の成功を達成した。

ABSTRACT

A longstanding challenge in robot learning for manipulation tasks has been the ability to generalize to varying initial conditions, diverse objects, and changing objectives. Learning based approaches have shown promise in producing robust policies, but require heavy supervision to efficiently learn precise control, especially from visual inputs. We propose a novel self-supervision technique that uses time-reversal to learn goals and provide a high level plan to reach them. In particular, we introduce the time-reversal model (TRM), a self-supervised model which explores outward from a set of goal states and learns to predict these trajectories in reverse. This provides a high level plan towards goals, allowing us to learn complex manipulation tasks with no demonstrations or exploration at test time. We test our method on the domain of assembly, specifically the mating of tetris-style block pairs. Using our method operating atop visual model predictive control, we are able to assemble tetris blocks on a physical robot using only uncalibrated RGB camera input, and generalize to unseen block pairs. sites.google.com/view/time-reversal

研究の動機と目的

  • 教師ありデータや特権状態情報なしに、頑健な操作ポリシーを学習する課題に対処すること。
  • 視覚的操作タスクにおいて、未見の物体や初期状態に一般化すること。
  • たとえば、ペンキャップを外すようなタスクを簡単に逆転させられる性質を活用し、高レベルのタスク構造を推定する自己教師付き手法を開発すること。
  • カメラキャリブレーションなしに、未校正のRGB観測のみを用いて、複雑な組立タスクにおけるシミュレーションから実世界への転送を可能にすること。

提案手法

  • 目的状態を摂動させ、前向きダイナミクスを記録することで軌道を収集し、それらを逆転させて教師データを生成する。
  • 時間反転モデル(TRM)を訓練し、現在の状態から逆軌道を予測することで、目的状態へ戻るパスを学習する。
  • TRMを用いて、目的状態が未知であっても、任意の現在状態から目的状態へ向かう誘導的状態軌道を生成できる。
  • TRMを視覚的モデル予測制御(MPC)と統合し、実ロボット実行のための低レベルアクションを生成する。
  • シミュレーションでドメインランダマイゼーションを適用することで、カメラキャリブレーションなしにシミュレーションから実世界への転送を可能にする。
  • 高レベル計画(TRMを介して)と低レベル制御を分離することで、モジュラーな学習と計画効率の向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1タスク軌道の時間反転が、教師ありデータや真実の目的状態なしに操作ポリシーを学習するための有効な自己教師付き信号として機能するか?
  • RQ2TRMは、実世界の操作タスクにおいて未見のブロックペアにどの程度一般化するか?
  • RQ3ドメインランダマイゼーションを用いてシミュレーションで訓練されたTRMは、複雑な組立タスクにおいて、シミュレーションから実世界への転送を成功させるか?
  • RQ4視覚的制御において、形状報酬ベースラインや完全に教師ありのベースラインと比較して、TRMは性能を向上させるか?
  • RQ5TRMに基づく計画は、視覚的操作タスクにおいて、広範な探索や特権状態情報の必要性を低減するか?

主な発見

  • TRASSは、実際のKUKA IIWA-7ロボットを用いて、未校正のRGB入力と教師ありデータなしに、既視のブロックペアで75%、未視のブロックペアで50%の成功率を達成した。
  • 未視のブロックペアにおいて、形状報酬ベースラインを2倍以上の成功率で上回り、完全に教師ありのベースラインと同等の性能を達成した。
  • ドメインランダマイゼーションを用いたシミュレーションから実世界への転送は成功し、シミュレーションにおける接触ノイズの低減により、実世界の性能がシミュレーションを上回った。
  • 825件の実ロボット軌道を用いた視覚的ダイナミクスモデルのファインチューニングは性能向上に寄与しなかった。これは、過酷なドメインランダマイゼーションがすでに十分な耐性を提供していたことを示唆している。
  • 訓練中にカメラランダマイゼーションを除去しても、実世界の成功に顕著な影響がなかった。これは、モデルの一般化が視覚的ドメインシフトに対して頑健であることを示している。
  • 本手法により、逆軌道からの自己教師付き信号のみを用いて、視覚的MPCが複雑なテトリス風ブロック結合タスクを成功に解決できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。