Skip to main content
QUICK REVIEW

[論文レビュー] In the Eye of the Beholder: Gaze and Actions in First Person Video

Yin Li, Miao Liu|arXiv (Cornell University)|May 31, 2020
Human Pose and Action Recognition参考文献 115被引用数 8
ひとこと要約

本論文では、確率的分布としての注視を確率的ユニットを用いてモデル化することで、1人称動画において注視と行動認識を同時に推定する深層学習モデルを提案する。この手法は、サンプリングされた注視分布から注視マップを生成し、特徴集約をガイドする。EGTEA Gaze+ および EPIC-Kitchens の両データセットで最先端の性能を達成しており、推論時に注視データが不要な状況でも同様の結果を示す。

ABSTRACT

We address the task of jointly determining what a person is doing and where they are looking based on the analysis of video captured by a headworn camera. To facilitate our research, we first introduce the EGTEA Gaze+ dataset. Our dataset comes with videos, gaze tracking data, hand masks and action annotations, thereby providing the most comprehensive benchmark for First Person Vision (FPV). Moving beyond the dataset, we propose a novel deep model for joint gaze estimation and action recognition in FPV. Our method describes the participant's gaze as a probabilistic variable and models its distribution using stochastic units in a deep network. We further sample from these stochastic units, generating an attention map to guide the aggregation of visual features for action recognition. Our method is evaluated on our EGTEA Gaze+ dataset and achieves a performance level that exceeds the state-of-the-art by a significant margin. More importantly, we demonstrate that our model can be applied to larger scale FPV dataset---EPIC-Kitchens even without using gaze, offering new state-of-the-art results on FPV action recognition.

研究の動機と目的

  • 注視が行動認識に重要な注視の手がかりを提供する1人称動画において、注視と行動の同時推定の課題に取り組む。
  • スキアドやノイズ、関係のない凝視による不確実性を、注視を潜在的な確率的分布としてモデル化することで克服する。
  • 注視モデリングと行動認識を統合した包括的な深層学習フレームワークを構築し、エゴセントリック動画タスクの性能を向上させる。
  • 1人称ビジョン研究のための包括的なベンチマークデータセット、EGTEA Gaze+ を作成。同期された動画、注視追跡、手マスク、行動アノテーションを含む。
  • 提案手法が、注視データが推論時に使用されない大規模データセット EPIC-Kitchens に対しても一般化可能であることを実証。推論時に注視データが不要な状況でも最先端の結果を達成。

提案手法

  • 深層ネットワーク内に確率的ユニットを用いて、注視を潜在的な確率的分布としてモデル化し、不確実性を考慮した注視マッピングを可能にする。
  • 確率的注視ユニットからサンプリングすることで、動画内の行動関連領域を強調する空間的・時間的注視マップを生成する。
  • 生成された注視マップを用いて、行動認識ブランチにおける空間的および時間的特徴集約を実行し、関連する視覚的手がかりに焦点を当てる。
  • EGTEA Gaze+ データセットを用いて、注視推定と行動認識の両方を最適化する統合的目的関数により、エンドツーエンドのモデルを学習する。
  • EPIC-Kitchens にモデルを適応する際には、注視の監視を一様な事前分布に置き換え、IG-65M で事前学習された強力な CSN152 バックボーンを用いる。
  • 過学習を防ぐために、エアリー・ストッピングと学習率の段階的低下を適用する。特に、大きなバックボーンと限られたバッチサイズの状況において有効である。

実験結果

リサーチクエスチョン

  • RQ11人称注視データにおける不確実性を効果的にモデル化することで、行動認識の性能を向上させることは可能か?
  • RQ2注視と行動を同時に学習する統合モデルは、分離したモデルに比べて、エゴセントリック動画解析において優れた性能を示せるか?
  • RQ3注視を確率的注視プライアとして統合することで、大規模データセットにおける行動認識性能はどの程度向上するか?
  • RQ4注視監視を用いて学習したモデルは、注視アノテーションのないデータセット(例:EPIC-Kitchens)に対しても一般化可能か?
  • RQ5バックボーンネットワークおよび学習戦略の選択が、統合的注視と行動認識の性能にどのように影響を与えるか?

主な発見

  • 提案手法は、EGTEA Gaze+ データセットにおいて、注視推定および行動認識の両面で、先行手法を顕著に上回る最先端の性能を達成した。
  • EPIC-Kitchens において、見ているセットではトップ1正解率が 60.05%、トップ5正解率が 81.97% を達成し、未見のセットではそれぞれ 38.14% と 63.81% を記録。両セットで、すべての単一モデル手法を上回った。
  • 強い CSN152 ベースラインに比べ、見ているセットでトップ1正解率 +0.3%、トップ5正解率 +1.0% の向上を達成。未見のセットでは、それぞれ +0.5% と +0.8% の向上を示した。
  • 実際の注視データを使用しない一様な注視事前分布を用いても、競争力のある結果を達成しており、強力な一般化能力を示している。
  • アブレーションスタディの結果、性能向上の主な要因は、CSN152 のような強力なバックボーンと事前学習であることが確認された。提案された注視マップ機構は、追加的かつ一貫した性能向上をもたらした。
  • 2020 年の EPIC-Kitchens チャレンジにおいて、未見のテストセットで 2 位、見ているテストセットで 4 位を達成。光流、音声、オブジェクト検出器を用いた手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。