Skip to main content
QUICK REVIEW

[論文レビュー] A2J-Transformer: Anchor-to-Joint Transformer Network for 3D Interacting Hand Pose Estimation from a Single RGB Image

Changlong Jiang, Xiao Yang|arXiv (Cornell University)|Apr 7, 2023
Human Pose and Action Recognition被引用数 5
ひとこと要約

A2J-Transformerは、1枚のRGB画像から3次元相互作用手ポーズ推定を行うための新しいトランスフォーマー基盤手法を提案する。学習可能な3次元アンカー点をクエリとして用い、局所的な微細な詳細とグローバルな関節的文脈を同時にモデル化する。InterHand2.6Mで9.63 mmのMPJPEを達成し、遮蔽に強く、深度データへの汎用性も優れている。

ABSTRACT

3D interacting hand pose estimation from a single RGB image is a challenging task, due to serious self-occlusion and inter-occlusion towards hands, confusing similar appearance patterns between 2 hands, ill-posed joint position mapping from 2D to 3D, etc.. To address these, we propose to extend A2J-the state-of-the-art depth-based 3D single hand pose estimation method-to RGB domain under interacting hand condition. Our key idea is to equip A2J with strong local-global aware ability to well capture interacting hands' local fine details and global articulated clues among joints jointly. To this end, A2J is evolved under Transformer's non-local encoding-decoding framework to build A2J-Transformer. It holds 3 main advantages over A2J. First, self-attention across local anchor points is built to make them global spatial context aware to better capture joints' articulation clues for resisting occlusion. Secondly, each anchor point is regarded as learnable query with adaptive feature learning for facilitating pattern fitting capacity, instead of having the same local representation with the others. Last but not least, anchor point locates in 3D space instead of 2D as in A2J, to leverage 3D pose prediction. Experiments on challenging InterHand 2.6M demonstrate that, A2J-Transformer can achieve state-of-the-art model-free performance (3.38mm MPJPE advancement in 2-hand case) and can also be applied to depth domain with strong generalization.

研究の動機と目的

  • 重度の自己遮蔽および相互遮蔽下での1枚のRGB画像からの3次元相互作用手ポーズ推定の課題に対処すること。
  • 従来のモデルフリー手法がグローバルな文脈認識に欠け、手同士の外観パターンが曖昧であるという限界を克服すること。
  • 2次元から3次元へのリフトを改善するために、アンカー点に3次元空間の事前知識を埋め込むことで、より良い深度推定を実現すること。
  • 共通の特徴からクエリ固有の適応的マルチスケール特徴学習に置き換えることで、局所的特徴の識別能を向上させること。
  • 個別にカスタマイズされた手モデルを必要とせず、複雑な手の相互作用に対しても頑健な、柔軟なモデルフリー回帰を可能にすること。

提案手法

  • トランスフォーマーに基づく非局所なエンコーディング・デコーディングフレームワークを導入し、アンカー点同士が自己注意によりグローバルに相互作用できるようにし、関節のアーチファクト的関係を捉える。
  • 各3次元アンカー点を学習可能なクエリとして扱い、すべての手関節への3次元オフセットを予測することで、すべてのクエリ予測の重み付き統合により関節位置推定を実現する。
  • 各クエリごとに適応的マルチスケール畳み込み特徴学習(MSDAM)を用い、パターン適合能力を高め、類似した手の外観を区別できるようにする。
  • アンカー点を2次元ではなく3次元空間に配置することで、直接3次元オフセット予測が可能となり、単眼RGBからの深度推定が向上する。
  • アンカー点の関節予測への関連度に基づき、学習可能な重みを割り当てることで、遮蔽に対する耐性を高める。
  • アンカー位置の精緻化と空間的文脈モデリングの向上を目的として、トランスフォーマーを用いた3次元アンカー精緻化モジュールを統合する。

実験結果

リサーチクエスチョン

  • RQ1学習可能なクエリベースの3次元アンカー機構は、1枚のRGB画像における重度の遮蔽下でも3次元手ポーズ推定を向上させることができるか?
  • RQ2アンカー点同士のグローバルな自己注意は、相互作用する手の関節構造を捉える能力をどのように向上させるか?
  • RQ32次元アンカーと比較して、3次元アンカー配置は2次元から3次元へのリフト性能をどの程度向上させるか?
  • RQ4適応的マルチスケール特徴学習は、関節回帰時に視覚的に類似した手領域をどの程度効果的に区別できるか?
  • RQ5提案手法は、深度ベースおよびRGBベースの3次元手ポーズ推定ベンチマークに十分に汎用性を示せるか?

主な発見

  • A2J-Transformerは、2人で手を触れ合う状況を想定したInterHand2.6Mデータセットで、9.63 mmのMPJPEを達成し、新たなSOTAを樹立した。
  • アブレーションスタディにより、トランスフォーマーに基づくグローバルモデリング部を削除するとMPJPEが5 mm増加し、遮蔽耐性に果たすその重要性が裏付けられた。
  • 標準的な自己注意に適応的マルチスケール特徴学習(MSDAM)を置き換えると性能が1 mm低下し、特徴の識別能向上に寄与していることが検証された。
  • 3次元アンカー重み機構を削除すると4.4 mm性能が低下し、すべてのアンカーが関節予測に同等に寄与しているわけではないことが示された。
  • 256個の平面内アンカーと3個の深度アンカーを用いることで、精度(9.63 mm MPJPE)と推論速度(25.65 FPS)の最良のトレードオフが達成された。アンカー数を減らすと性能が低下した。
  • 深度データにも良好に汎用可能であり、NYUおよびHANDS 2017データセットでも高い性能を示し、マルチモality間での頑健性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。