Skip to main content
QUICK REVIEW

[論文レビュー] Joint Hand Motion and Interaction Hotspots Prediction from Egocentric Videos

Shaowei Liu, Subarna Tripathi|arXiv (Cornell University)|Apr 4, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本論文は、エゴセントリック動画における将来のハンド・オブジェクト相互作用を予測するための新規アプローチを提案する。本手法は、次のアクティブなオブジェクト上のハンドの運動軌跡とインタラクション・ホットスポット(接触点)を同時に予測する。オブジェクトセントリック・トランスフォーマー(OCT)に条件付き変分オートエンコーダー(C-VAE)ヘッドを組み合わせ、自己注意機構を用いてハンド・オブジェクト相互作用を推論し、確率的サンプリングにより不確実性をモデル化する。このアプローチにより、エゴセントリック・ビデオのデータセットである Epic-Kitchens-55、Epic-Kitchens-100、EGTEA Gaze+ において、完全に自動化され大規模なデータ収集が可能な状態で最先端の性能を達成した。

ABSTRACT

We propose to forecast future hand-object interactions given an egocentric video. Instead of predicting action labels or pixels, we directly predict the hand motion trajectory and the future contact points on the next active object (i.e., interaction hotspots). This relatively low-dimensional representation provides a concrete description of future interactions. To tackle this task, we first provide an automatic way to collect trajectory and hotspots labels on large-scale data. We then use this data to train an Object-Centric Transformer (OCT) model for prediction. Our model performs hand and object interaction reasoning via the self-attention mechanism in Transformers. OCT also provides a probabilistic framework to sample the future trajectory and hotspots to handle uncertainty in prediction. We perform experiments on the Epic-Kitchens-55, Epic-Kitchens-100, and EGTEA Gaze+ datasets, and show that OCT significantly outperforms state-of-the-art approaches by a large margin. Project page is available at https://stevenlsw.github.io/hoi-forecast .

研究の動機と目的

  • アクションラベルやピクセルレベルの予測を超えて、エゴセントリック動画における将来のハンド・オブジェクト相互作用を予測すること。
  • 確率的フレームワークを用いて、将来のハンドの運動とオブジェクトの接触点における不確実性をモデル化すること。
  • 人間によるラベル付けなしに、自動的かつ大規模なデータ収集パイプラインを構築し、ハンドの軌跡とインタラクション・ホットスポットのラベルを生成すること。
  • 中間表現としての同時軌跡とホットスポット予測を活用することで、アクション予測性能を向上させること。
  • 正確で低次元の将来の相互作用予測を実現することで、ARおよびロボット工学分野における人間とAIの協働を促進すること。

提案手法

  • 自動データ収集パイプラインは、市販のハンド検出器とホモグラフィー投影を用い、将来のハンドおよび接触点の位置を最後の観測フレームに逆方向に投影することで、整合性のある大規模なトレーニングラベルを生成する。
  • オブジェクトセントリック・トランスフォーマー(OCT)は、ConvNetを用いて入力フレームの視覚的特徴を符号化し、ハンドおよびオブジェクトの特徴をオブジェクトセントリック・トークンとして、全体のフレーム特徴をコンテキスト・トークンとして扱う。
  • トランスフォーマーのエンコーダーにおける自己注意機構により、複数のフレームにわたるハンド、オブジェクト、環境的コンテキストを統合的に推論できる。
  • デコーダーに条件付き変分オートエンコーダー(C-VAE)ヘッドを設け、クロスアテンションにより導出された条件付き潜在変数から、ハンドの軌跡とインタラクション・ホットスポットを予測することで、不確実性をモデル化する。
  • 予測された軌跡とホットスポットを、自動収集されたデータからの真値ラベルと比較する再構成損失を用いてモデルを訓練する。
  • アクション予測タスクにおけるファインチューニングでは、OCTエンコーダにMLPヘッドを追加し、学習された表現の転移可能性を示す。

実験結果

リサーチクエスチョン

  • RQ1アクションラベルやピクセル予測と比較して、ハンドの運動軌跡とインタラクション・ホットスポットの同時予測が、エゴセントリック動画における将来の相互作用予測性能を向上させることができるか?
  • RQ2確率的ディープラーニングフレームワークを用いて、将来のハンド・オブジェクト相互作用における不確実性を効果的にモデル化できるか?
  • RQ3人間によるラベル付けなしに、大規模かつ自動的なデータ収集が、性能を損なわずに代替可能か?
  • RQ4軌跡とホットスポットの予測が、アクション予測などの下流タスクにどの程度寄与するか?
  • RQ5ハンドの運動とインタラクション・ホットスポットの条件付き依存関係をモデル化することで、予測精度がどの程度向上するか?

主な発見

  • OCTモデルは、Epic-Kitchens-55、Epic-Kitchens-100、EGTEA Gaze+ のすべてのデータセットにおいて、ハンドの軌跡とインタラクション・ホットスポットの両方の予測で、最先端の手法を著しく上回った。
  • アクション予測タスクにファインチューニングした際、EK55では動詞予測で4.3%、アクション予測で4.4%の絶対的向上を達成し、EK100では動詞予測で2.9%、アクション予測で2.6%の向上を示した。
  • C-VAEによる確率的モデリングにより、複数の妥当な将来のシナリオが得られる多様な、不確実性を考慮した予測が可能であることが、複数の妥当な将来の予測を示す定性的な可視化で確認された。
  • 自動データ収集パイプラインは、人間によるラベル付けなしに、大規模かつ高品質なラベルを効果的に生成でき、スケーラブルなトレーニングを可能にした。
  • 軌跡推定がインタラクション・ホットスポットの予測を向上させ、より多くの訓練データが得られれば性能が向上する傾向にあり、強力なデータ効率性が示された。
  • 事前学習済みのOCTモデルを、軌跡とホットスポットの予測タスクでファインチューニングすることで、学習から再構築する場合と比較して、より優れたアクション予測性能を達成した。これは、学習済み表現の汎化能力の高さを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。