Skip to main content
QUICK REVIEW

[論文レビュー] Learning Robotic Manipulation through Visual Planning and Acting

Angelina Wang, Thanard Kurutach|arXiv (Cornell University)|May 11, 2019
Robot Manipulation and Learning参考文献 50被引用数 18
ひとこと要約

本稿では、自己教師付きロボット相互作用から得られるデータを活用し、解釈可能な視覚的計画を学習し、学習された逆運動学制御器を介して実行する、データ駆動型のアプローチであるVisual Planning and Acting (VPA)を提案する。因果的InfoGANに基づく生成モデルを用いて画像空間での計画を実現し、制御には視覚サーボ制御ポリシーを採用することで、ロープのような変形性のある物体のサンプル効率が高く、解釈可能な操作が可能となり、障害物を含む環境下でPR2ロボットで20%の成功率を達成した。

ABSTRACT

Planning for robotic manipulation requires reasoning about the changes a robot can affect on objects. When such interactions can be modelled analytically, as in domains with rigid objects, efficient planning algorithms exist. However, in both domestic and industrial domains, the objects of interest can be soft, or deformable, and hard to model analytically. For such cases, we posit that a data-driven modelling approach is more suitable. In recent years, progress in deep generative models has produced methods that learn to `imagine' plausible images from data. Building on the recent Causal InfoGAN generative model, in this work we learn to imagine goal-directed object manipulation directly from raw image data of self-supervised interaction of the robot with the object. After learning, given a goal observation of the system, our model can generate an imagined plan -- a sequence of images that transition the object into the desired goal. To execute the plan, we use it as a reference trajectory to track with a visual servoing controller, which we also learn from the data as an inverse dynamics model. In a simulated manipulation task, we show that separating the problem into visual planning and visual tracking control is more sample efficient and more interpretable than alternative data-driven approaches. We further demonstrate our approach on learning to imagine and execute in 3 environments, the final of which is deformable rope manipulation on a PR2 robot.

研究の動機と目的

  • 解析的モデリングが不可能な現実世界の環境で変形性のある物体を操作する課題に対処すること。
  • 非剛体物体に対しては手動による状態と遷移の設計が必須となる伝統的な計画手法の限界を克服すること。
  • 人為的な視覚的計画やデモを必要としない、データ駆動型で自己教師付きのアプローチを開発すること。
  • 物理的実行前に視覚的に検査可能な計画を生成することで、安全で解釈可能な操作を実現すること。
  • 複雑で障害物が多数存在する環境下で、実際のPR2ロボット上でエンドツーエンドの視覚的計画と実行が可能であることを実証すること。

提案手法

  • ロープのような変形性のある物体のロボット-オブジェクト相互作用の生の画像データを、自己教師付きのランダムな相互作用から収集する。
  • C3IGAN(因果的条件付きInfoGAN)モデルを訓練し、計画に適した分離可能で構造的な潜在空間を学習する。
  • C3IGANモデルの潜在空間内で線形補間を用いて視覚的計画を生成し、その順序を再び画像観測にマッピングする。
  • 同じデータから逆運動学モデルを学習し、想像された視覚的計画を視覚サーボ制御で追跡する。
  • 環境的文脈(例:障害物の位置)をC3IGANに条件付け、物理的制約を尊重する計画を可能にする。
  • 操作を2段階に分解する:視覚的計画(軌道の想像)と視覚的追従(学習された制御による実行)。

実験結果

リサーチクエスチョン

  • RQ1データ駆動型モデルは、生の画像データから直接変形性のある物体の操作のための目的指向の視覚的計画を学習できるか?
  • RQ2実行前に視覚的検査が可能な画像空間における視覚的計画は、安全で解釈可能にできるか?
  • RQ3計画と制御を分離することで、エンドツーエンドのモデルフリー強化学習と比較して、サンプル効率と性能が向上するか?
  • RQ4訓練中に存在しなかった未観測の障害物配置にも一般化できるか?
  • RQ5C3IGANに基づく視覚的計画と学習された視覚サーボ制御の組み合わせは、現実世界のロボット操作においてどれほど有効か?

主な発見

  • C3IGANモデルは、障害物が存在する場合でさえも、物理的に妥当な操作軌道を表す視覚的に妥当な画像系列を生成するのを成功した。
  • 生成された視覚的計画の約15%が視覚的に妥当であり、障害物を巻き込むなどの物理的制約を満たしていた。
  • 逆運動学モデルは、障害物を含むロープ操作タスクにおいて、PR2ロボット上で視覚的に妥当な計画の20%を正常に実行した。
  • 本手法は解釈可能であった:失敗事例はしばしば想像された計画の視覚的検査によって検出可能であり、安全性が向上した。
  • 絶対的な成功率が低いものの、シミュレーションにおいてモデルフリー強化学習よりもサンプル効率と解釈可能性において優れた性能を示した。
  • 訓練中に見られなかった障害物配置に対してもモデルは一般化できており、環境の変動に対してある程度のロバストネスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。