Skip to main content
QUICK REVIEW

[論文レビュー] Physics-Based Dexterous Manipulations with Estimated Hand Poses and Residual Reinforcement Learning

Guillermo Garcia-Hernando, Edward Johns|arXiv (Cornell University)|Aug 7, 2020
Robot Manipulation and Learning参考文献 65被引用数 10
ひとこと要約

本論文では、深度センサーからのノイズの多い3次元手のポーズ推定値を補正する残留強化学習フレームワークを提案する。このフレームワークにより、VR内および実環境でのモーション再構築において、物理ベースの器用な操作が可能になる。物理シミュレータ内でモデルフリーの強化学習+アシスト学習(IL)エージェントを訓練し、微小で正確な関節補正を実行することで、『ジュースを注ぐ』タスクで93%、『コインを渡す』タスクで83.3%のタスク成功を達成。ベースラインを著しく上回り、入力ポーズと物理的に整合性のある仮想モーションのギャップを埋める。

ABSTRACT

Dexterous manipulation of objects in virtual environments with our bare hands, by using only a depth sensor and a state-of-the-art 3D hand pose estimator (HPE), is challenging. While virtual environments are ruled by physics, e.g. object weights and surface frictions, the absence of force feedback makes the task challenging, as even slight inaccuracies on finger tips or contact points from HPE may make the interactions fail. Prior arts simply generate contact forces in the direction of the fingers' closures, when finger joints penetrate virtual objects. Although useful for simple grasping scenarios, they cannot be applied to dexterous manipulations such as in-hand manipulation. Existing reinforcement learning (RL) and imitation learning (IL) approaches train agents that learn skills by using task-specific rewards, without considering any online user input. In this work, we propose to learn a model that maps noisy input hand poses to target virtual poses, which introduces the needed contacts to accomplish the tasks on a physics simulator. The agent is trained in a residual setting by using a model-free hybrid RL+IL approach. A 3D hand pose estimation reward is introduced leading to an improvement on HPE accuracy when the physics-guided corrected target poses are remapped to the input space. As the model corrects HPE errors by applying minor but crucial joint displacements for contacts, this helps to keep the generated motion visually close to the user input. Since HPE sequences performing successful virtual interactions do not exist, a data generation scheme to train and evaluate the system is proposed. We test our framework in two applications that use hand pose estimates for dexterous manipulations: hand-object interactions in VR and hand-object motion reconstruction in-the-wild.

研究の動機と目的

  • 侵襲的なハードウェアを用いずに、深度センサーと3次元手のポーズ推定器(HPE)のみを用いて、仮想環境内での現実的で物理的ガイドの整った器用な手と物体の相互作用を可能にすること。
  • 物理シミュレーションにおけるポーズ推定誤差と力フィードバックの欠如が、複雑な操作タスクで失敗を引き起こすという課題に対処すること。
  • HPEの精度を向上させるとともに、入力モーションと視覚的に類似した姿勢を維持しながら、タスク成功率を向上させる残留補正メカニズムを開発すること。
  • ポーズ報酬を用いたハイブリッド強化学習+アシスト学習(RL+IL)アプローチにより、多様な器用な操作タスクに一般化可能なポリシーを学習すること。
  • エンドツーエンドのシミュレーションベース学習により、ノイズの多いユーザー入力ポーズと物理的に妥当な仮想手のモーションの間のドメインギャップを埋めること。

提案手法

  • ノイズの多いHPE出力を物理的に妥当なターゲットポーズに修正するため、物理シミュレータ内でモデルフリーの強化学習設定で残留エージェントを訓練する。
  • 強化学習と敵対的アシスト学習(IL)を組み合わせ、ディスクラミネーターを用いてポリシーがエキスパートのモーショングラフの軌跡に類似したモーションを生成するよう促進する。
  • 3次元手のポーズ推定報酬を新たに導入し、仮想手のポーズと入力RGBD画像との間の再投影誤差を最小化することで、HPEの精度を向上させる。
  • モーショングラフデータと公開済みの手のポーズデータセットを組み合わせることで、実世界の相互作用データが不要な訓練シーケンスの生成スキームを設計し、教師あり事前学習と評価を可能にする。
  • ユーザー入力ポーズは逆運動学関数を介して仮想手モデルにマッピングされ、接触を伴う相互作用を達成するために微小な残留補正が適用される。
  • 本フレームワークは、2つの設定で評価されている:リアルタイムVRインタラクションと実環境でのモーション再構築。両者に同一のポリシーが適用されている。

実験結果

リサーチクエスチョン

  • RQ1残留強化学習エージェントは、ノイズの多い3次元手のポーズ推定値を補正し、シミュレーション内での物理ベースの器用な操作を効果的に可能にできるか?
  • RQ2ポーズ推定報酬を組み込むことで、補正された仮想手のポーズの視覚的類似性と正確性が、入力に比べてどの程度向上するか?
  • RQ3ハイブリッドRL+ILアプローチは、純粋なアシスト学習ベースやヒューリスティックな閉じ込みベースのベースラインに比べて、複雑な操作タスクでどの程度優れているか?
  • RQ4高感度なポーズ誤差に敏感な繊細なタスクにおいても、『ジュースを注ぐ』と『コインを渡す』といった異なる操作タスクに一般化可能か?
  • RQ5合成データ生成により、実環境での展開における訓練とテストのパフォーマンスギャップをどの程度埋められるか?

主な発見

  • 提案手法は、テストセットにおいて『ジュースを注ぐ』タスクで93.0%、『コインを渡す』タスクで83.3%のタスク成功率を達成。次善のベースライン(手を閉じる)の55.0%および38.0%を著しく上回った。
  • ポーズ報酬を導入したことで、『コインを渡す』テストセットにおける3次元手のポーズ誤差(E_pose)は33.15 mmに低下。対照的に、手を閉じるベースラインでは35.46 mmであった。
  • 『ジュースを注ぐ』テストセットにおいて、不安定化までの平均シーケンス長(T̄)は全長の59.6%に達し、手を閉じるベースライン(47.0%)およびIK(24.8%)を上回った。
  • 『ジュースを注ぐ』トレーニングセットでは、T̄が98.2%、E_poseが25.43 mmに達し、ポリシーの一般化能力とトレーニング中の安定性が強く示された。
  • アブレーションスタディの結果、ポーズ報酬を除去すると性能が低下し、入力ポーズとの視覚的類似性を維持する役割が確認された。
  • 『コインを渡す』タスクでは過学習の懸念があったが、トレーニングで80.0%、テストで83.3%の成功を達成し、高精度な課題に対しても耐性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。