Skip to main content
QUICK REVIEW

[論文レビュー] HandOccNet: Occlusion-Robust 3D Hand Mesh Estimation Network

JoonKyu Park, Yeonguk Oh|arXiv (Cornell University)|Mar 28, 2022
Human Pose and Action Recognition被引用数 13
ひとこと要約

HandOccNet は、2つのトランスフォーマー基盤モジュール(FIT と SET)を導入することで、オクルージョンに強い3次元手メッシュ推定を実現する新規なネットワークである。FIT は、ソフトマックスおよびシグモイドベースのアテンションを組み合わせたハイブリッドアテンション機構を用いて、手に特化した特徴をオクルージョン領域に注入する。一方、SET は残差学習を用いた自己アテンションにより特徴を精緻化し、Dex-YCB データセットで 14.04 MPJPE および 5.80 PA-MPJPE を達成し、先行手法を上回る性能を発揮した。

ABSTRACT

Hands are often severely occluded by objects, which makes 3D hand mesh estimation challenging. Previous works often have disregarded information at occluded regions. However, we argue that occluded regions have strong correlations with hands so that they can provide highly beneficial information for complete 3D hand mesh estimation. Thus, in this work, we propose a novel 3D hand mesh estimation network HandOccNet, that can fully exploits the information at occluded regions as a secondary means to enhance image features and make it much richer. To this end, we design two successive Transformer-based modules, called feature injecting transformer (FIT) and self- enhancing transformer (SET). FIT injects hand information into occluded region by considering their correlation. SET refines the output of FIT by using a self-attention mechanism. By injecting the hand information to the occluded region, our HandOccNet reaches the state-of-the-art performance on 3D hand mesh benchmarks that contain challenging hand-object occlusions. The codes are available in: https://github.com/namepllet/HandOccNet.

研究の動機と目的

  • 物体や自己干渉による重度のオクルージョン下でも正確な 3次元手メッシュ推定を達成する課題に対処すること。
  • 複雑な手と物体の相互作用や部分的可視性を伴う現実世界のシナリオにおける耐障害性を向上させること。
  • オクルージョン領域における局所的および長距離の空間的依存関係を効果的に活用する深層学習アーキテクチャの開発。
  • MPJPE および PA-MPJPE の両指標において、HO-3D や Dex-YCB のようなベンチマークデータセットで先行手法を上回ること。
  • オクルージョン領域における手の特徴の注入と精緻化に、ハイブリッドアテンション機構の有効性を検証すること。

提案手法

  • FIT は二重アテンション機構を用いる:グローバルな文脈を捉えるためのソフトマックスベースのアテンションと、ノイズの高いアテンションスコアを抑制するためのシグモイドベースのアテンションを組み合わせ、精緻化されたアテンションマップを生成する。
  • 生成されたアテンションマップが、主な特徴マップからの値特徴に適用され、残差特徴が生成される。その後、層正則化とスキップ接続を備えたフィードフォワードネットワークにより、この特徴が精緻化される。
  • SET は標準的な自己アテンション機構を採用し、クエリ、キー、値の投影を経て、残差接続とフィードフォワード精緻化により空間表現を向上させる。
  • ネットワークは FIT と SET を段階的に統合する:FIT がオクルージョン領域に手の情報を注入し、その後 SET が得られた特徴をさらに精緻化することで、メッシュ推定の精度が向上する。
  • 空間トークン間のクロスモダリティアテンション計算を可能にするために、1×1畳み込みとリシェイプ処理が特徴マップに適用される。
  • モデルは標準的な 3次元メッシュ監視により学習され、プロクラステス変換前後で MPJPE および PA-MPJPE の指標を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1ソフトマックスおよびシグモイドベースのアテンションを組み合わせたハイブリッドアテンション機構は、オクルージョン領域における特徴の注入を改善できるか?
  • RQ2FIT と SET モジュールを段階的に組み合わせることで、重度のオクルージョン下における 3次元手メッシュ推定がどのように向上するか?
  • RQ3提案手法は、Dex-YCB のような大規模で重度のオクルージョンが見られるデータセットにおいて、最先端の手法を上回る性能を発揮するか?
  • RQ4プロクラステス変換なしでも、モデルがどの程度の精度を維持するかを評価することで、内在的な幾何的耐障害性を示すことができるか?
  • RQ5モデルは、現実世界の設定で見られる多様な手と物体の相互作用や複雑なオクルージョンパターンにも一般化可能か?

主な発見

  • Dex-YCB データセットでは、HandOccNet は 14.04 MPJPE および 5.80 PA-MPJPE を達成し、2番目に優れた手法(Liu et al. [8])の 15.28 MPJPE および 6.58 PA-MPJPE を上回った。
  • プロクラステス変換の前でも、HandOccNet は HO-3D で 24.9 MPJPE を達成し、Pose2Mesh(33.2)、Hasson et al.(55.2)、I2L-MeshNet(26.8)、Liu et al.(30.0)を上回った。
  • HO-3D から得た重度のオクルージョンを持つ画像における定性的な結果から、FIT による効果的な特徴の注入のおかげで、親指などのオクルージョン領域の指の再構築がより良好に行われていることが示された。
  • FPHA での可視化比較では、HandOccNet は Hasson et al. [6] よりもより正確で一貫性のあるメッシュ再構築を生成しており、特に困難なオクルージョンケースで顕著であった。
  • アブレーションスタディの結果、FIT におけるハイブリッドアテンション機構が、オクルージョン領域における誤検出(誤った陽性)を低減させることで、アテンションマップの品質を著しく向上させた。
  • FIT と SET の組み合わせにより、手の大部分が視認不能であっても、微細な手の幾何形状を保持できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。