[論文レビュー] Hierarchical Temporal Transformer for 3D Hand Pose Estimation and Action Recognition from Egocentric RGB Videos
本稿では、エゴセントリックRGB動画から3次元手関節ポーズを推定し、同時に動作を認識するための階層的時系列変換器ネットワークを提案する。短時間の時系列特徴をポーズ推定に、長時間の特徴を動作認識に活用する。2つの異なる受容 field を持つ級列型変換器エンコーダーを用い、FPHA および H2O ベンチマークで最先端の性能を達成した。
Understanding dynamic hand motions and actions from egocentric RGB videos is a fundamental yet challenging task due to self-occlusion and ambiguity. To address occlusion and ambiguity, we develop a transformer-based framework to exploit temporal information for robust estimation. Noticing the different temporal granularity of and the semantic correlation between hand pose estimation and action recognition, we build a network hierarchy with two cascaded transformer encoders, where the first one exploits the short-term temporal cue for hand pose estimation, and the latter aggregates per-frame pose and object information over a longer time span to recognize the action. Our approach achieves competitive results on two first-person hand action benchmarks, namely FPHA and H2O. Extensive ablation studies verify our design choices.
研究の動機と目的
- エゴセントリックRGB動画における手の自己遮蔽と動作の曖昧さに起因する手の動き理解の課題に対処すること。
- フレーム間の短時間の時系列一貫性を活用することで、3次元手関節ポーズ推定のロバスト性を向上させること。
- 「牛乳を注ぐ」「牛乳を置く」など複雑な手の動作(例:'pour milk', 'place milk')を、個々のフレームの予測から得られる長時間の時系列的文脈を集約することで認識すること。
- 階層的かつ級列型の変換器アーキテクチャを用いて、手の動きと物体操作の間の意味的相関をモデル化すること。
- 反復的リファインメントや手作業で設計された特徴を用いずに、ポーズ推定と動作認識を同時に最適化できるエンドツーエンドで学習可能なフレームワークを開発すること。
提案手法
- 短時間ポーズエンコーダー(ウィンドウサイズ t=16)と長時間動作エンコーダー(ウィンドウサイズ T=128)を備えた2本のブランチからなる階層的変換器アーキテクチャを設計する。
- 各フレームの画像特徴を抽出するためにビジョン変換器バックボーンを用い、それをポーズおよび動作変換器ブロックに供給する。
- ポーズブロックは、学習可能なクエリメカニズムを用いて、フレームごとの3次元手関節座標と物体カテゴリーラベルを出力する。
- アクションブロックは、マルチヘッド自己注意を用いて、長い時間窓内でフレームごとのポーズおよび物体予測を集約し、学習可能なクラストークンを用いる。
- ポーズブロックとアクションブロックを級列に接続し、アクションブロックの入力にポーズブロックからのフレームごとのポーズ、物体ラベル、画像特徴を含める。
- 3次元キーポイント回帰と動作分類のクロスエントロピーを組み合わせたジョイント損失を用いて、ネットワーク全体をエンドツーエンドで学習する。
実験結果
リサーチクエスチョン
- RQ1異なる時間スケールでの時系列的文脈モデリングは、エゴセントリック動画における3次元手関節ポーズ推定と動作認識を向上させ得るか?
- RQ2級列型の変換器アーキテクチャは、並列型や単一ブランチ型アーキテクチャと比較して、ポーズと動作の同時学習において優位性を示すか?
- RQ3手の動きと物体操作の意味的相関をモデル化することで、動作認識の精度はどの程度向上するか?
- RQ4長距離時系列モデリングを用いることで、個々のフレームでは曖昧な動作の認識が向上するか?
- RQ5単純なエンドツーエンドのフォワードパス変換器アーキテクチャは、反復的またはマルチステージ手法を上回る性能を発揮できるか?
主な発見
- 提案された階層的時系列変換器は、FPHA データセットで94.09%、H2O データセットで86.36%の動作認識精度を達成し、新たな最先端の結果を樹立した。
- アブレーションスタディの結果、級列構造は並列アーキテクチャを0.87%(FPHA)および6.19%(H2O)上回り、階層的モデリングの有効性を裏付けた。
- アクションブロックへのフレームごとのポーズまたは物体ラベルの入力を削除すると、精度が低下(例:93.57% および 91.65%)し、それらの入力の重要性を示した。
- アテンション可視化の結果、アクションブロックが動作を定義するキーフレーム(例:'take out espresso' の最終フレーム)に最も強く注目していることが確認された。
- 時間ウィンドウサイズを16から128フレームに拡大すると、FPHAでの動作認識精度が90.96%から94.09%に向上し、長距離モデリングの有効性が裏付けられた。
- 単一フレームの情報ではなく、全フレームの時系列的文脈を活用することで、行動の曖昧さ(例:'pour milk' と 'place milk' の区別)を効果的に解消できた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。