[論文レビュー] Following Gaze Across Views
本論文では、同一シーンの複数のビュー間で人間の注視を追跡するエンドツーエンドのディープラーニングモデルを提案する。注視の注目度、注視の向き、ビュー間の幾何的関係を活用する。注視アノテーションのみで訓練され、人物がフレーム外を向いていても、2番目のビューにおける注視位置を予測できる。VideoGaze データセットにおいて、全テストセットで平均平均精度(mAP)0.255の最先端性能を達成した。
Following the gaze of people inside videos is an important signal for understanding people and their actions. In this paper, we present an approach for following gaze across views by predicting where a particular person is looking throughout a scene. We collect VideoGaze, a new dataset which we use as a benchmark to both train and evaluate models. Given one view with a person in it and a second view of the scene, our model estimates a density for gaze location in the second view. A key aspect of our approach is an end-to-end model that solves the following sub-problems: saliency, gaze pose, and geometric relationships between views. Although our model is supervised only with gaze, we show that the model learns to solve these subproblems automatically without supervision. Experiments suggest that our approach follows gaze better than standard baselines and produces plausible results for everyday situations.
研究の動機と目的
- 制約のないシーンにおいて、複数のカメラビュー間で注視を追跡する課題に取り組むこと。注視がソースビューの外に延びる場合を含む。
- ヘッドポーズや幾何的関係の明示的教師信号なしに、注視アノテーションのみを用いて、ターゲットビューにおける注視位置を予測する手法を開発すること。
- このようなモデルのトレーニングと評価を可能にする、大規模なマルチビュー注視追跡のベンチマークデータセットを構築すること。
- エンドツーエンドの訓練を通じて、注視の注目度推定や幾何的変換といったサブ問題が、モデルが暗黙的に学習できることを示すこと。
提案手法
- 注視の注目度予測、注視方向推定、ビュー間の幾何的変換のための別々のパスを持つマルチパスウェイアーキテクチャを採用する。
- 注視アノテーションのみを用いて注視予測を同時に最適化することで、ネットワークが注視の注目度とポーズ推定を自己教師的に学習できるようにする。
- 幾何的パスウェイは、カメラビュー間の変換(回転と平行移動)を推定し、注視をソースビューからターゲットビューに射影可能にする。
- VideoGaze データセット上でエンドツーエンドに訓練される。このデータセットには、ビデオフレーム内の頭部、目、注視の合計47,456件のアノテーションが含まれる。
- 異なるシーンからのフレームを用いて訓練するシーン変化検出ヘッドを追加することで、モデルの一部を拡張し、シーン変化検出を可能にする。
- 平均平均精度(mAP)を用いて性能を評価し、各パスウェイの寄与度を評価するためのアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1ヘッドポーズや幾何的関係の明示的教師信号なしに、注視アノテーションのみを用いて、2番目のビューにおける注視位置を予測できるか?
- RQ2エンドツーエンドの訓練を通じて、モデルが注視の注目度、注視方向、ビュー間の幾何的関係をどの程度暗黙的に学習できるか?
- RQ3時間的に離れている、または幾何的に異なるビューに対して、モデルの一般化性能はどの程度高いか?
- RQ4注視のターゲットがシーン外にある場合(=シーン変化)、モデルはそれを検出できるか?
主な発見
- 提案されたモデルは、VideoGaze データセットの全テストセットで平均平均精度(mAP)0.255を達成し、すべてのベースラインを大きく上回った。
- ソースフレームから1秒以上離れた時間的に離れたフレームを含む縮小テストセットでは、モデルは0.255 mAPを達成したが、静的ベースラインモデルは0.187に低下した。
- ビュー間の差が大きい場合、注視の注目度パスウェイがより重要になるため、モデルはそのような状況でより良い性能を発揮した。
- アブレーションスタディの結果、垂直軸の回転と平行移動のみを用いた場合に最高の性能が得られ、これは一般的なカメラの動きと整合的である。
- シーン変化検出を拡張したモデルは、平均平均精度0.877を達成し、ランダムチャンスの0.5をはるかに上回った。
- 内部パスウェイの可視化により、モデルが明示的な教師信号なしに、幾何的関係、注視方向、注目領域を学習していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。