[論文レビュー] Keypoint Transformer: Solving Joint Identification in Challenging Hands and Object Interactions for Accurate 3D Pose Estimation
本稿では、CNN特徴量と自己注意メカニズムを用いてキーポイントの局所化と関節同定を分離することで、3次元手およびオブジェクトポーズ推定のための新規手法Keypoint Transformerを提案する。本手法は、従来手法の半数のパラメータでInterHand2.6MおよびHO-3Dで最先端の性能を達成するとともに、75,000枚の完全に3次元アノテーションが付与された3次元手オブジェクトインタラクション画像を含む新規の大規模なH2O-3Dデータセットを導入する。
We propose a robust and accurate method for estimating the 3D poses of two hands in close interaction from a single color image. This is a very challenging problem, as large occlusions and many confusions between the joints may happen. State-of-the-art methods solve this problem by regressing a heatmap for each joint, which requires solving two problems simultaneously: localizing the joints and recognizing them. In this work, we propose to separate these tasks by relying on a CNN to first localize joints as 2D keypoints, and on self-attention between the CNN features at these keypoints to associate them with the corresponding hand joint. The resulting architecture, which we call "Keypoint Transformer", is highly efficient as it achieves state-of-the-art performance with roughly half the number of model parameters on the InterHand2.6M dataset. We also show it can be easily extended to estimate the 3D pose of an object manipulated by one or two hands with high performance. Moreover, we created a new dataset of more than 75,000 images of two hands manipulating an object fully annotated in 3D and will make it publicly available.
研究の動機と目的
- 重度の隠蔽と外観の曖昧性を伴う2手のインタラクションにおける正確な3次元ポーズ推定の課題に対処すること。
- ヒートマップベースの関節回帰の制限を避けるために、キーポイントの局所化と関節アイデンティティの認識を分離すること。
- アテンションメカニズムを用いて、軽量でありながら高精度な3次元手およびオブジェクトポーズ推定アーキテクチャを開発すること。
- ベンチマーク用に、オブジェクトと2手のインタラクションを対象とした新規の大規模かつ完全に3次元アノテーションが付与されたデータセットの作成と公開すること。
提案手法
- まず、識別子を割り当てずに、2次元キーポイント位置をヒートマップとして1つのCNNベースのモデルで予測する。
- 次に、キーポイント特徴量間の関係をモデル化することで、自己注意メカニズムを用いて各キーポイントを関節またはバックグラウンドに割り当てる。
- クロスアテンションモジュールが、各3次元関節クエリに対して関連するキーポイントを選択し、関節固有の特徴量集約を可能にする。
- アーキテクチャはポーズ表現に依存せず、MANOメッシュや関節角度形式を含む複数のパラメータ化形式をサポートする。
- 本手法は、InterHand2.6MおよびHO-3Dで訓練および評価され、広範なアブレーションおよび定性的な分析が実施されている。
- 17のマルチビューシーケンスから得られた75,000枚の画像からなる新規のH2O-3Dデータセットが導入され、マーカーレス最適化パイプラインを用いて3次元アノテーションが付与されている。
実験結果
リサーチクエスチョン
- RQ1ヒートマップベースの回帰と比較して、トランスフォーマーに基づくアプローチは、重度の隠蔽を伴う2手のインタラクションにおいて関節の不確実性解消を改善できるか?
- RQ2キーポイントの局所化と関節アイデンティティの認識を分離することで、パラメータ数を減らしながらも性能が向上するか?
- RQ3本手法は、手がオブジェクトを操作する状況において、3次元オブジェクトポーズ推定に一般化可能か?
- RQ4極度の隠蔽を伴う複雑な現実世界の手オブジェクトインタラクションシーケンスにおいて、モデルの性能はどの程度か?
- RQ5直接的なヒートマップ回帰と比較して、キーポイント特徴量間の自己注意が、どの程度の耐性向上をもたらすか?
主な発見
- Keypoint Transformerは、従来手法の半数程度のパラメータ数で、InterHand2.6Mで最先端の性能を達成した。
- HO-3Dデータセットでは、3次元関節誤差が16.7 mmにまで低下し、以前の最先端手法を上回った。
- H2O-3Dデータセットでは、オブジェクトポーズのMSSDが7.9 cmであり、個々のオブジェクトではマグカップで6.5 cm、ハサミで13.5 cmの誤差を示した。
- アテンションの可視化により、モデルが可視関節に対して正しいキーポイント特徴量に注目し、隠蔽された関節に対しては近隣の特徴量に注目していることが確認された。
- 本手法は複雑なインタラクションに良好に一般化されるが、極度の隠蔽や相互透過の状況では時々失敗することがある。
- 導入されたH2O-3Dデータセットには、60,998枚のトレーニング画像と15,342枚のテスト画像が含まれており、正確な3次元アノテーションが付与されており、公開予定である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。