Skip to main content
QUICK REVIEW

[論文レビュー] Keypoints into the Future: Self-Supervised Correspondence in Model-Based Reinforcement Learning

Lucas Manuelli, Yunzhu Li|arXiv (Cornell University)|Sep 10, 2020
Reinforcement Learning in Robotics参考文献 27被引用数 34
ひとこと要約

本論文は、自己監視型視覚対応をモデルベース強化学習システムの潜在状態として導入し、MPCによる閉ループ制御を可能にし、視覚ベースの操作におけるシムtoリアル転送とカテゴリレベルの一般化を示す。

ABSTRACT

Predictive models have been at the core of many robotic systems, from quadrotors to walking robots. However, it has been challenging to develop and apply such models to practical robotic manipulation due to high-dimensional sensory observations such as images. Previous approaches to learning models in the context of robotic manipulation have either learned whole image dynamics or used autoencoders to learn dynamics in a low-dimensional latent state. In this work, we introduce model-based prediction with self-supervised visual correspondence learning, and show that not only is this indeed possible, but demonstrate that these types of predictive models show compelling performance improvements over alternative methods for vision-based RL with autoencoder-type vision training. Through simulation experiments, we demonstrate that our models provide better generalization precision, particularly in 3D scenes, scenes involving occlusion, and in category-generalization. Additionally, we validate that our method effectively transfers to the real world through hardware experiments. Videos and supplementary materials available at https://sites.google.com/view/keypointsintothefuture

研究の動機と目的

  • 高次元観測を持つロボット操作のための視覚ベースのモデル学習を促進し、有効にする。
  • 自己監視型密な視覚記述子を用いて追跡されたキーポイントから形成される潜在状態を提案する。
  • 潜在キーポイント空間でのダイナミクスを学習し、閉ループ制御のためにMPCを用いたオンライン計画を行う。
  • オートエンコーダーやトランスポートベースのベースラインよりも一般化と実機転送を改善することを示す。
  • シミュレーションとハードウェアの両方の実験で、遮蔽やカテゴリレベルの変動に対する頑健性を示す。

提案手法

  • 自己監視型視覚対応モデルによって抽出された追跡キーポイントから、密な視覚記述子を用いて潜在状態zを学習する。
  • ホライズンHにわたる多ステップ予測誤差を最小化する順方向ダイナミクスモデル z_{t+1}=f(z_t, a_t) を学習する(L_dynamics)。
  • y(キーポイント位置)から z を構築する variants: Descriptor Set (DS)、Spatial Descriptor Set (SDS)、Weighted Descriptor Set (WDS)、およびそれらの組み合わせ(WSDS)。
  • 学習可能な写像 phi(y; α) を用いて z を形成し、信頼できない点を扱うためにキーポイント上の convex ウェイトを用いる(WDS)。
  • ダイナミクス学習中は密な対応ネットワークを固定する。
  • 学習済みダイナミクスを用いて、目的潜在状態 z* をゴールとし、H のホライズンで報酬を最大化するため MPPI ベースの MPC を用いたオンライン計画を実行する。
  • シミュレーション(トップダウン、角度、遮蔽、マグカップ/カテゴリ)と、Kuka操作機での実機評価を行い、ダイナミクス学習には約10分の相互作用データ、ゴール指定には1つのデモを使用する。

実験結果

リサーチクエスチョン

  • RQ1自己監視型密な視覚対応は、視覚ベースの操作におけるモデルベース強化学習の有益で転用可能な潜在状態となり得るか?
  • RQ2DS、SDS、WDS、WSDS のような異なる descriptor ベースの潜在状態構成は、遮蔽とカテゴリ変動の下でダイナミクス学習と閉ループ制御にどう影響するか?
  • RQ3部分的な遮蔽やカテゴリレベルの一般化を特に含むシミュレーションと実機で、オートエンコーダーおよびトランスポーターベースのベースラインを上回るか?
  • RQ4限られた相互作用データと1つのデモによるゴール指定で、実世界への転送を達成できるか?

主な発見

  • 密な視覚対応に基づく潜在状態は、シミュレーション課題とハードウェアの両方で、ベースラインよりも精度が高く、サンプル効率の良いモデルベースRLを実現する。
  • 遮蔽下では、DSよりSDS/WDS/WSDSが、遮蔕されたキーポイントへの頑健性のためにダイナミクス精度とMPC性能を改善する。
  • カテゴリレベルのマグのタスクでは、より多くのキーポイントを用いる手法(DS/WDS)が、形状変動を捉えるためスパースな variant よりも性能が良くなる;SDS/WDSは頑健性を維持。
  • TransporterおよびAutoencoderベースラインと比較して、SDS/WDSはタスク全体で姿勢/角度の偏差をより良くし、遮蔽とマグカテゴリで最大の改善を示す。
  • ハードウェア実験では、2秒のMPCホライズンと5 Hzの指令レートで長期軌道を安定化し、約10分の相互作用データと1つのデモで、複数の軌道にわたり安定化を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。