Skip to main content
QUICK REVIEW

[論文レビュー] HandsFormer: Keypoint Transformer for Monocular 3D Pose Estimation ofHands and Object in Interaction

Shreyas Hampali, Sayan Sarkar|arXiv (Cornell University)|Apr 29, 2021
Human Pose and Action Recognition参考文献 55被引用数 12
ひとこと要約

HandsFormerは、1枚のRGB画像から2つの相互作用する手の3次元ポーズを推定するためのキーポイント変換器モデルを提案する。ヒートマップの極値を入力とし、自己注意機構を用いて関節の配置を解消する。InterHand2.6MおよびHO-3Dにおいてベースライン手法より17%の性能向上を達成し、手と物体の相互作用を対象とした新しい完全3次元アノテーション付きのアクションシーケンスデータセットを提供する。

ABSTRACT

We propose a robust and accurate method for estimating the 3D poses of two hands in close interaction from a single color image. This is a very challenging problem, as large occlusions and many confusions between the joints may happen. Our method starts by extracting a set of potential 2D locations for the joints of both hands as extrema of a heatmap. We do not require that all locations correctly correspond to a joint, not that all the joints are detected. We use appearance and spatial encodings of these locations as input to a transformer, and leverage the attention mechanisms to sort out the correct configuration of the joints and output the 3D poses of both hands. Our approach thus allies the recognition power of a Transformer to the accuracy of heatmap-based methods. We also show it can be extended to estimate the 3D pose of an object manipulated by one or two hands. We evaluate our approach on the recent and challenging InterHand2.6M and HO-3D datasets. We obtain 17% improvement over the baseline. Moreover, we introduce the first dataset made of action sequences of two hands manipulating an object fully annotated in 3D and will make it publicly available.

研究の動機と目的

  • 2つの相互作用する手の3次元ポーズを1枚のRGB画像から推定する課題に取り組む。この際、重なりや隠蔽、関節の曖昧さが顕著に現れる。
  • 2次元キーポイント検出が不完全またはノイズを含む場合でも、注意メカニズムを活用して正しい3次元配置を推定できる堅牢な手法を開発する。
  • 手とそれらが操作する物体の3次元ポーズを同時に推定するアプローチを拡張し、相互作用に配慮したポーズ推定を実現する。
  • 今後の研究を支援するため、2手による物体操作を対象とした3次元アノテーション付きのアクションシーケンスデータセットを提供する。

提案手法

  • すべての関節が検出されたり正しく局所化されたりする必要がないように、ヒートマップの局所的極値として潜在的な2次元関節位置を抽出する。
  • これらの2次元キーポイント候補の外観と空間的位置を学習可能な埋め込み表現でエンコードし、変換器の入力系列を構築する。
  • 自己注意機構を用いた変換器アーキテクチャを採用し、重なったり隠されたりした関節間の曖昧さを解消し、長距離依存関係をモデル化する。
  • 学習された注意特徴量から直接回帰することで3次元関節座標を端末から予測し、ポーズと配置の共同最適化を可能にする。
  • 入力系列に物体固有のトークンを追加することで、物体キーポイントの予測を拡張し、それらの3次元座標を予測する。
  • 手と物体のポーズ推定を同時に最適化するため、3次元キーポイント座標に対する標準的な回帰損失関数を用いてモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ11枚の画像から、隠蔽やノイズを含む2次元検出結果がある中で、変換器ベースのアプローチが曖昧な3次元関節配置を効果的に解消できるか。
  • RQ21つのモデルが、相互作用する2つの手とそれらが操作する物体の3次元ポーズをどれほど良好に同時に推定できるか。
  • RQ3InterHand2.6MおよびHO-3Dといった困難なベンチマークにおいて、提案手法がベースライン手法に比べてどれほど精度を向上させるか。
  • RQ4動的な運動状態にある手と物体の複雑な相互作用シーケンスに対しても、モデルが一般化できるか。

主な発見

  • HandsFormerは、InterHand2.6Mデータセットにおいて、ベースライン手法に比べて3次元キーポイント誤差で17%の相対的改善を達成した。
  • 注意機構を活用することで、不完全または曖昧な2次元キーポイント検出に対しても、正しい3次元配置を推定できる高いロバスト性を示した。
  • 物体操作のシナリオに対しても効果的に一般化でき、手と操作対象の物体の両方の3次元ポーズ推定を高精度で実現した。
  • 本研究では、2人の手が物体を操作するアクションシーケンスを対象とした、完全に3次元アノテーションが施された新しいデータセットを公開し、今後のインタラクティブな3次元手と物体ポーズ推定分野の研究を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。