Skip to main content
QUICK REVIEW

[論文レビュー] 3D Interacting Hand Pose Estimation by Hand De-occlusion and Removal

Hao Meng, Sheng Jin|arXiv (Cornell University)|Jul 22, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

本稿では、3次元相互作用手ポーズ推定のための新規なハンド非透過除去および除去(HDR)フレームワークを提案する。このフレームワークは、タスクを独立したハンド非透過、不要なハンドの除去、および単一ハンドポーズ推定に分解する。本手法は、新しい大規模な合成非透過ハンドデータセット(非透過インターハンド、AIH)を活用することで、インターハンド2.6Mで最先端の性能を達成し、重度の隠蔽と外見の曖昧さに対処する点で、先行手法を大きく上回っている。

ABSTRACT

Estimating 3D interacting hand pose from a single RGB image is essential for understanding human actions. Unlike most previous works that directly predict the 3D poses of two interacting hands simultaneously, we propose to decompose the challenging interacting hand pose estimation task and estimate the pose of each hand separately. In this way, it is straightforward to take advantage of the latest research progress on the single-hand pose estimation system. However, hand pose estimation in interacting scenarios is very challenging, due to (1) severe hand-hand occlusion and (2) ambiguity caused by the homogeneous appearance of hands. To tackle these two challenges, we propose a novel Hand De-occlusion and Removal (HDR) framework to perform hand de-occlusion and distractor removal. We also propose the first large-scale synthetic amodal hand dataset, termed Amodal InterHand Dataset (AIH), to facilitate model training and promote the development of the related research. Experiments show that the proposed method significantly outperforms previous state-of-the-art interacting hand pose estimation approaches. Codes and data are available at https://github.com/MengHao666/HDR.

研究の動機と目的

  • 単一RGB画像からの3次元相互作用ハンドポーズ推定における重度のハンド同士の隠蔽と外見の曖昧さの課題に対処すること。
  • 複雑な相互作用ハンドタスクを、ハンド非透過および除去、その後に続く単一ハンドポーズ推定というより単純なサブタスクに分解すること。
  • 非透過およびモーダルセグメンテーション、非透過、除去の教師データを備えた大規模な合成データセットを構築し、トレーニングとベンチマークに活用すること。
  • 相互作用ハンド画像を単一ハンドに似た入力に変換することで、最先端の単一ハンドポーズ推定器を効果的に活用できること。

提案手法

  • HDRフレームワークは3つのモジュールから構成される:ハンド非透過セグメンテーションモジュール(HASM)、ハンド非透過および除去モジュール(HDRM)、および単一ハンドポーズ推定器(SHPE)。
  • HASMは両方のハンドの非透過および可視セグメンテーションマスクを生成し、非透過および除去のための空間的および外見的手がかりを提供する。
  • HDRMは画像レベルでの非透過を実行し、遮られていたハンド部分の外見を予測することで非透過を実現し、画像操作により不要なハンドを除去する。
  • 画像回復品質を向上させるために敵対的訓練を用い、特徴の相互作用と受容 field を強化するためにトランスフォーマーブロックを導入する。
  • 非透過インターハンド(AIH)と呼ばれる新しい大規模な合成データセットを構築した。2つのバージョンがある:AIH_Syn(コピーペーストによるリアルな外見)とAIH_Render(3次元メッシュレンダリングによる物理的に妥当なポーズ)。
  • 本手法はAIH上でHDRMをトレーニングし、得られたHDR変換画像を市販のSHPEに供給して最終的な3次元ポーズ予測を実行する。

実験結果

リサーチクエスチョン

  • RQ1重度のハンド同士の隠蔽と外見の曖昧さの下で、HDRフレームワークは3次元相互作用ハンドポーズ推定をどの程度効果的に改善できるか?
  • RQ2提案された非透過インターハンド(AIH)データセットは、既存のベンチマークと比較して、モデルの一般化性能と性能をどの程度向上させるか?
  • RQ3非透過と除去のそれぞれの寄与度は、相互作用ハンドシナリオにおけるポーズ推定誤差低減にどの程度寄与しているか?
  • RQ4トランスフォーマーブロックやディスクライマーといった設計選択が、HDRフレームワークの最終的性能に与える影響はいかほどか?
  • RQ5HDRフレームワークは、トレーニング分布を超えた実世界のデータセットにも一般化可能か?

主な発見

  • 提案されたHDRフレームワークは、インターハンド2.6Mベンチマークで18.10 mmのMPJPEを達成し、以前の最先端手法を大きく上回っている。
  • 除去モジュールを無効化するとMPJPEが34.4%上昇し、不要なハンドからの干渉低減におけるその重要性が示された。
  • 非透過モジュールを無効化するとMPJPEが9.5%上昇し、遮られていた部分の回復が正確なポーズ推定に不可欠であることが確認された。
  • トランスフォーマーブロックを導入することで、ベースラインと比較して性能が4.8%向上した。これは、特徴学習におけるその重要性を示している。
  • AIH_Renderのみでトレーニングした場合でも18.10 mmのMPJPEを達成し、物理的に妥当な合成データが一般化に非常に有効であることが示された。
  • HDRMモジュールの時間コストは1フレームあたりたった0.6 msであり、タスクの複雑さを考慮しても、全体の推論が効率的であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。