[論文レビュー] ACR: Attention Collaboration-based Regressor for Arbitrary Two-Hand Reconstruction
ACRは、中心部とパーツベースのアテンションを用いて手の表現を分離し、遮蔽や切断に対する感受性を低減することで、モノクロナルRGB画像から任意の二の手3次元再構築を実現するアテンションコラボレーションベースの回帰器を提案する。InterHand2.6M(8.49 MPJPE)において最先端の相互作用手手法を上回り、FreiHandにおいても単一手の最先端手法と同等の性能を達成し、現実世界や困難な状況下でも頑健であることを示した。
Reconstructing two hands from monocular RGB images is challenging due to frequent occlusion and mutual confusion. Existing methods mainly learn an entangled representation to encode two interacting hands, which are incredibly fragile to impaired interaction, such as truncated hands, separate hands, or external occlusion. This paper presents ACR (Attention Collaboration-based Regressor), which makes the first attempt to reconstruct hands in arbitrary scenarios. To achieve this, ACR explicitly mitigates interdependencies between hands and between parts by leveraging center and part-based attention for feature extraction. However, reducing interdependence helps release the input constraint while weakening the mutual reasoning about reconstructing the interacting hands. Thus, based on center attention, ACR also learns cross-hand prior that handle the interacting hands better. We evaluate our method on various types of hand reconstruction datasets. Our method significantly outperforms the best interacting-hand approaches on the InterHand2.6M dataset while yielding comparable performance with the state-of-the-art single-hand methods on the FreiHand dataset. More qualitative results on in-the-wild and hand-object interaction datasets and web images/videos further demonstrate the effectiveness of our approach for arbitrary hand reconstruction. Our code is available at https://github.com/ZhengdiYu/Arbitrary-Hands-3D-Reconstruction.
研究の動機と目的
- 遮蔽、切断、相互の混乱が生じる任意の状況における3次元手再構築の課題に対処すること。
- 手の部分同士の依存関係を低減し、表現を分離することで、不完全または損傷のある入力に対する頑健性を向上させること。
- 相互依存性が低下しても、手同士の相互作用モデリングを維持し、相互作用する手の正確な再構築を保証すること。
- 制限された二の手入力にとどまらず、実世界の環境(例:屋外の画像や動画)に実用的に展開可能な手法を開発すること。
提案手法
- ACRは、手の中心とパーツごとのアテンションマップを生成するためのアテンションエンコーダ(AE)を採用し、相互作用手の事前知識を用いて可視性を推定し、特徴学習をガイドする。
- グローバル(G)、パーツベース(P)、および相互手アテンション事前知識(C)の表現を統合する、新規のアテンションコラボレーションベースの特徴集約器(ACFA)を採用し、協調的な手再構築を実現する。
- 相互作用フィールドを備えた相互手事前知識推論モジュールにより、手同士の依存関係の強さを動的に調整し、相互作用のモデリングを強化する。
- エンドツーエンドで学習可能であり、手のバウンディングボックスや真値スケールを必要としないため、現実世界の状況への展開が可能である。
- 3次元メッシュ再構築のためにパラメトリックな手モデル(例:MANO)を活用し、3次元キーポイントおよびメッシュアノテーションによる監視を実施する。
- マルチスケナリオデータセット上で、標準的な3次元手再構築損失(例:MPJPE、MPVPE)を用いてネットワークを学習する。
実験結果
リサーチクエスチョン
- RQ12本の手の相互作用を入力として必要とせず、切断、分離、または遮蔽された手を含む任意の手の配置に一般化可能な3次元手再構築手法は可能か?
- RQ2手同士および手のパーツ同士の相互依存関係を明示的に軽減することで、部分的遮蔽や切断に対する頑健性をどのように向上できるか?
- RQ3相互手事前知識推論が、相互依存性が低下した状況でも、複雑な状況下で正確な相互作用モデリングを維持するためにどの程度補償できるか?
- RQ4統合的特徴学習と比較して、提案手法のアテンションコラボレーション機構は、多様なデータセットにおける性能および一般化性においてどのように優れているか?
主な発見
- ACRは、InterHand2.6Mの相互作用手(IH)サブセットで8.49 MPJPEを達成し、以前の最先端手法IntagHandを上回った。
- FreiHandの単一手ベンチマークでは、6.91 MPJPEを達成し、単一手の最先端手法と同等の性能を示し、優れた一般化能力を確認した。
- アブレーションスタディの結果、パーツベースおよび相互手事前知識表現の両方が性能向上に顕著に寄与しており、特に相互作用手のシナリオにおいて相互手事前知識がより大きな向上をもたらした。
- 屋外の画像・動画および手と物体の相互作用データセットにおける定性的な結果から、重度の遮蔽や非標準的なポーズ下でも正確な再構築が可能であることが示された。
- 単一の手、エゴビュー、切断された手などの入力変動に対しても頑健であることが確認され、実世界応用における実用性を裏付けた。
- グローバル、パーツ、相互手事前知識表現を統合した際、全InterHand2.6Mデータセットで5.21 PAMPJPEを達成し、全体的な性能が優れていることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。