Skip to main content
QUICK REVIEW

[論文レビュー] Contextual Reinforcement Learning of Visuo-tactile Multi-fingered Grasping Policies

Visak Kumar, Tucker Hermans|arXiv (Cornell University)|Nov 20, 2019
Robot Manipulation and Learning被引用数 12
ひとこと要約

本稿では、視覚的・触覚的知覚を用いた文脈的強化学習アプローチを提案し、3次元バウンディングボックスのキーポイントを用いて物体の形状とサイズを表現するとともに、指先の接触信号を用いてシミュレーションから現実世界への一般化ギャップを埋める。ポリシーは人間のデモンストレーションの事前知識を用いて完全にシミュレーション内で訓練され、未学習の物体形状に対しても一般化し、ファインチューニングなしで現実世界での実装を達成する。

ABSTRACT

Using simulation to train robot manipulation policies holds the promise of an almost unlimited amount of training data, generated safely out of harm's way. One of the key challenges of using simulation, to date, has been to bridge the reality gap, so that policies trained in simulation can be deployed in the real world. We explore the reality gap in the context of learning a contextual policy for multi-fingered robotic grasping. We propose a Grasping Objects Approach for Tactile (GOAT) robotic hands, learning to overcome the reality gap problem. In our approach we use human hand motion demonstration to initialize and reduce the search space for learning. We contextualize our policy with the bounding cuboid dimensions of the object of interest, which allows the policy to work on a more flexible representation than directly using an image or point cloud. Leveraging fingertip touch sensors in the hand allows the policy to overcome the reduction in geometric information introduced by the coarse bounding box, as well as pose estimation uncertainty. We show our learned policy successfully runs on a real robot without any fine tuning, thus bridging the reality gap.

研究の動機と目的

  • シミュレーションベースの訓練を用いて現実世界への展開を実現することで、多指型ロボットハンドの把持におけるシミュレーションから現実世界への一般化ギャップを解消する。
  • 人間の手の動きのデモンストレーションを事前知識として用いることで、把持ポリシーの高次元探索空間を低減する。
  • 物体の形状の多様性に対する一般化を向上させるために、物体を生の視覚特徴ではなく3次元バウンディングボックスのキーポイントで表現する。
  • 指先センサからの触覚フィードバックを統合することで、現実世界の展開における幾何的およびポーズ推定の不確実性を克服する。
  • ファインチューニングなしに、1つのポリシーをさまざまな物体形状にゼロショットで展開可能にするために、文脈的ポリシー学習を実現する。

提案手法

  • 人間の手の把持のRGB動画を用いて最先端のポーズ推定により3次元手のポーズを推定し、シミュレーション内での報酬形状信号としてデモンストレーション軌道を抽出する。
  • 物体の幾何学的形状とサイズを、直方体の8つの頂点の3次元座標として表現し、ポリシーネットワークの文脈変数として使用する。
  • 二値の指先接触信号を状態観測の一部として統合し、把持の質や物体との相互作用に関するリアルタイムフィードバックを提供する。
  • 視覚的および触覚的状態を統合したシミュレーテッド環境で、深層決定的ポリシー勾配(DDPG)に基づく文脈的強化学習ポリシーを訓練する。
  • 文脈変数(バウンディングボックス)を活用することで、学習時に見未曾る新しい物体形状に対してもポリシーが一般化可能となる。
  • RGBベースのポーズ推定器による視覚入力とBioTacの触覚センサによる接触フィードバックを用いて、実際のロボットに最終ポリシーを展開する。

実験結果

リサーチクエスチョン

  • RQ1完全にシミュレーション内で訓練された1つの強化学習ポリシーが、ファインチューニングなしに未学習の物体形状の現実世界での多指型ハンドの把持に一般化可能か?
  • RQ2バウンディングボックスキーポイント表現が、視覚的・触覚的把持において多様な物体幾何形状への一般化を可能にする文脈変数としてどれほど有効か?
  • RQ3触覚フィードバックは、シミュレーションから現実世界への移行におけるポーズ推定誤差や形状の不一致に対するロバストネスをどの程度向上させるか?
  • RQ4人間のデモンストレーション軌道を報酬事前知識として組み込むことで、シミュレーション内でのシミュレーションから現実世界への移行におけるサンプル効率とポリシー性能がどの程度向上するか?
  • RQ5物体の文脈と触覚フィードバックに条件付けた1つのポリシーが、例えばピンチグリップとパワーグリップといった複数のグリップスタイルを学習可能か?

主な発見

  • 提案されたポリシーは、完全にシミュレーション内で訓練された後、コンドームやシリンダーといった未学習の物体形状を現実世界で成功裏に把持し、ファインチューニングなしに実装を達成した。
  • バウンディングボックスキーポイントの文脈と触覚接触信号の組み合わせにより、直方体近似とは大きく異なる物体形状に対してもポリシーが適応可能となった。
  • 実際のロボット上で、手作業によるモデルベースのグリッピングプランナと同等の性能を達成し、強力なシミュレーションから現実世界への一般化を示した。
  • 人間のデモンストレーションに基づく報酬形状は、シミュレーション内での訓練段階でサンプル効率とポリシー収束を著しく向上させた。
  • 単一のポリシーが、単に物体の文脈を変更するだけで、再トレーニングやアーキテクチャ変更なしに複数のグリップスタイルにゼロショットで展開可能であることを実証した。
  • 触覚フィードバックはロバストネスにとって不可欠であり、視覚的ポーズ推定が不正確であったり、バウンディングボックスによる物体幾何の表現が不十分であっても、接触を検知し維持可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。