Skip to main content
QUICK REVIEW

[論文レビュー] Monocular Real-time Hand Shape and Motion Capture using Multi-modal Data

Yuxiao Zhou, Marc Habermann|arXiv (Cornell University)|Mar 21, 2020
Human Pose and Action Recognition参考文献 53被引用数 8
ひとこと要約

本稿では、新しい深層学習アーキテクチャを用いて、2次元/3次元アノテート画像と独立した3次元モーショングラフ(MoCap)データを統合することで、100fpsの推論速度を達成し、最先端の精度を実現するリアルタイムでモノクローラルなハンド形状およびモーショングラフ推定手法を提示する。2段階のネットワークである、3次元関節位置の検出を担当するDetNetと、1回のフォワードパスで関節回転を回帰するエンドツーエンドの逆運動学ネットワーク(IKNet)により、ポーズの正確性と解剖学的妥当性が著しく向上する。

ABSTRACT

We present a novel method for monocular hand shape and pose estimation at unprecedented runtime performance of 100fps and at state-of-the-art accuracy. This is enabled by a new learning based architecture designed such that it can make use of all the sources of available hand training data: image data with either 2D or 3D annotations, as well as stand-alone 3D animations without corresponding image data. It features a 3D hand joint detection module and an inverse kinematics module which regresses not only 3D joint positions but also maps them to joint rotations in a single feed-forward pass. This output makes the method more directly usable for applications in computer vision and graphics compared to only regressing 3D joint positions. We demonstrate that our architectural design leads to a significant quantitative and qualitative improvement over the state of the art on several challenging benchmarks. Our model is publicly available for future research.

研究の動機と目的

  • 単一のRGBカメラのみを用いて、高精度なリアルタイムモノクローラルハンドモーショングラフ推定を可能にすること。
  • 2次元/3次元アノテート画像と独立した3次元モーショングラフ(MoCap)データを含む、すべての利用可能なトレーニングデータモダリティを活用しない既存手法の限界を克服すること。
  • 3次元関節位置の回帰に加えて、関節回転を直接回帰することで、コンピュータグラフィックスおよびVR/ARアプリケーションへの直接的利用を可能にすること。
  • MoCapデータからの共同監視と、3次元関節位置からの弱い監視を通じて、ポーズの事前知識を学習することで、ロバストネスと解剖学的正確性を向上させること。
  • ペairedデータが限られている状況でも、画像およびモーショングラフデータを効果的に活用できる統合アーキテクチャを設計すること。

提案手法

  • 本手法は2モジュールのアーキテクチャを採用する:2次元および3次元関節予測を同時に最適化するマルチタスク学習を用いて、3次元ハンド関節検出を実行するDetNet。
  • DetNetは、実際の2次元/3次元アノテート付き画像と合成画像の組み合わせで訓練され、モノクローラルRGB入力からの頑健な3次元関節推定を可能にする。
  • エンドツーエンドの逆運動学ネットワーク(IKNet)は、DetNetの3次元関節予測を入力とし、1回のフォワードパスで関節回転を回帰する。
  • IKNetは、MoCapデータからの直接的な回転監視と、3次元関節位置データからの弱い監視を組み合わせて訓練され、正確なポーズ事前知識を学習する。
  • 回転推定の精度を向上させるために、クaternionにL2損失とコサイン損失を組み合わせた損失関数が採用されている。
  • RHD、STB、3DPosData、MoCapデータといった多様なデータソースを共同で訓練することで、汎化性能とロバストネスを最大化している。

実験結果

リサーチクエスチョン

  • RQ12次元/3次元アノテート画像と独立した3次元モーショングラフ(MoCap)データといった複数のデータモダリティを、1つのディープラーニングモデルが効果的に活用できるか。
  • RQ23次元関節位置の回帰に加えて、3次元関節予測から直接関節回転を回帰することで、3次元位置の回帰のみに比べて、精度と解剖学的妥当性が向上するか。
  • RQ3MoCapデータからの回転監視で訓練されたエンドツーエンドの逆運動学ネットワークは、後処理によるフィッティングや弱い監視に依存する手法を上回る性能を示すか。
  • RQ43次元関節位置からの弱い監視と、直接的な回転監視を組み合わせることで、モデルのロバストネスと汎化性能にどのような影響を与えるか。
  • RQ5検出と回転回帰を分離したアーキテクチャ設計は、トレーニングの安定性と性能にどの程度寄与するか。

主な発見

  • 提案手法は100fpsの推論速度を達成し、単一のRGBカメラでリアルタイム性能を実現する。
  • DOベンチマークでは、同じトレーニングデータを使用した場合、前人最高(0.923)を上回るAUC 0.948を達成する。
  • IKNetの導入により、DetNet単体の結果に比べてAUCが2.5ポイント向上し、学習されたポーズ事前知識の価値が示された。
  • MoCapデータからの回転監視を除去すると、3次元関節位置が正確であっても解剖学的に不正確なポーズが生成されるため、その必要性が裏付けられた。
  • L2損失とコサイン損失の組み合わせが最高の精度をもたらし、特にコサイン損失が回転差分の推定に有効であることが判明した。
  • アブレーションスタディにより、DetNetのノイズを含む3次元予測(3DPosData経由)を用いてIKNetを訓練することが、実世界データへの汎化性能向上に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。