[論文レビュー] Forecasting Human-Object Interaction: Joint Prediction of Motor Attention and Actions in First Person Video
本論文では、第一人称動画における将来の手の軌道(モータリーダンス)、インタラクションのホットスポット(物体上の接触ポイント)、および将来の行動を同時に予測する深層学習モデルを提案する。手の動きを確率的変数としてモデル化することで、ネットワークは予測された手の動きを用いて空間的・時系列的特徴選択をガイドし、EGTEA Gaze+およびEPIC-Kitchensの行動予測とホットスポット局在化において最先端の性能を達成した。
We address the challenging task of anticipating human-object interaction in first person videos. Most existing methods ignore how the camera wearer interacts with the objects, or simply consider body motion as a separate modality. In contrast, we observe that the international hand movement reveals critical information about the future activity. Motivated by this, we adopt intentional hand movement as a future representation and propose a novel deep network that jointly models and predicts the egocentric hand motion, interaction hotspots and future action. Specifically, we consider the future hand motion as the motor attention, and model this attention using latent variables in our deep model. The predicted motor attention is further used to characterise the discriminative spatial-temporal visual features for predicting actions and interaction hotspots. We present extensive experiments demonstrating the benefit of the proposed joint model. Importantly, our model produces new state-of-the-art results for action anticipation on both EGTEA Gaze+ and the EPIC-Kitchens datasets. Our project page is available at https://aptx4869lm.github.io/ForecastingHOI/
研究の動機と目的
- 意図的な手の動きをモータリーダンスとしてモデル化することで、第一人称動画における人間-物体インタラクションの予測という課題に取り組む。
- モータリーダンスをインタラクションホットスポットの予測と統合することで、行動予測の性能を向上させる。
- 確率的深層学習を用いて、将来の手の動きと物体のインタラクション領域における不確実性を同時にモデル化する。
- モータリーダンスがエゴセントリックビジョンにおける視覚的予測のための重要な予測的表現であることを示す。
提案手法
- モデルは、将来の手の軌道をモータリーダンスとして扱い、確率的変数としてステノスティックユニットを用いて表現する深層ネットワークを採用する。
- モータリーダンスを用いて、行動およびホットスポット予測のための特徴的空間的・時系列的視覚特徴に注目する。
- インタラクションホットスポットは、物体上の接触領域を強調する空間的注目マップとして予測される。
- モデルは、教師付き信号として真値のモータリーダンス、インタラクションホットスポット、行動ラベルを用いて学習される。
- 共同学習フレームワークにより、モータリーダンス、ホットスポット、行動予測のエンドツーエンド最適化が可能となる。
- 推論時、モデルは行動発生直前の動画クリップから、3つの出力を同時に予測する。
実験結果
リサーチクエスチョン
- RQ1モータリーダンスを確率的表現としてモデル化することで、第一人称動画における行動予測性能が向上するか?
- RQ2モータリーダンスとインタラクションホットスポットの共同予測が、将来の行動予測をどのように向上させるか?
- RQ3物体が曖昧な状況下で、モータリーダンスが将来のインタラクション領域をどれほど正確に局在化するか?
- RQ4推論時に観測された手の座標を必要とせずに、手の軌道を予測できるか?
- RQ5EGTEA Gaze+およびEPIC-Kitchensのような多様なエゴセントリックデータセットに、モデルはどの程度一般化するか?
主な発見
- 提案手法は、EPIC-Kitchensで29.6のF1スコア、EGTEA Gaze+で25.69のF1スコアを達成し、従来手法をそれぞれ3.6%および5.4%上回る新たなSOTAを達成した。
- EGTEA Gaze+では、平均移動誤差が0.23、最終移動誤差が0.36を記録し、カルマンフィルターやGPRを上回り、観測された手の座標を必要としていないにもかかわらずLSTMと同等の性能を示した。
- 曖昧な状況下でも、モデルはインタラクションホットスポットを正しく予測でき、例として「ストーブを操作する」シナリオでストーブのノブを正しく接触ポイントとして特定した。
- 可視化結果から、手が見えない場合でも、予測されたモータリーダンスが一貫して正しい物体およびインタラクション領域に注目していることが示された。
- EPIC-KitchensではEGTEA Gaze+よりも一般化性能が優れており、これはより多くのトレーニングサンプルが利用可能だったためと推測される。
- 将来的なアクティブな物体が見えない場合に失敗するケースが発生しており、今後のモデルには論理的推論の統合が求められる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。