[論文レビュー] Connecting Gaze, Scene, and Attention: Generalized Attention Estimation via Joint Modeling of Gaze and Scene Saliency
本稿では、多タスク深層学習フレームワークを提案し、3次元の注視方向(ヨーとピッチ)とシーンの注目度を同時にモデル化することで、多様な自然的状況下での一般化された視覚的注意推定を実現する。GazeFollow、EYEDIAP、SynHeadの3つのデータセットを統合的に学習することで、注視方向・注目度予測で最先端の性能を達成し、MMDBデータセットにおける新しい一般化された注視予測タスクで平均適合率0.902を達成。これは、フレーム内とフレーム外の注視ターゲットを効果的に区別できることを示している。
This paper addresses the challenging problem of estimating the general visual attention of people in images. Our proposed method is designed to work across multiple naturalistic social scenarios and provides a full picture of the subject's attention and gaze. In contrast, earlier works on gaze and attention estimation have focused on constrained problems in more specific contexts. In particular, our model explicitly represents the gaze direction and handles out-of-frame gaze targets. We leverage three different datasets using a multi-task learning approach. We evaluate our method on widely used benchmarks for single-tasks such as gaze angle estimation and attention-within-an-image, as well as on the new challenging task of generalized visual attention prediction. In addition, we have created extended annotations for the MMDB and GazeFollow datasets which are used in our experiments, which we will publicly release.
研究の動機と目的
- 注視が画像フレーム内または外を向いているかどうかにかかわらず、制約のない自然的状況下の社会的相互作用における一般化された視覚的注意推定の課題に対処すること。
- 3次元注視ベクトルと注視の可能性マップを同時に推定する統一モデルを構築し、多様な注視行動において正確な予測を可能にすること。
- 従来の研究がフレーム内注視ターゲットやスクリーンベースの眼動追跡に限定していたのを改善すること。
- 将来の一般化された注意モデル研究を支援するため、MMDBおよびGazeFollowの拡張されたアノテーションを提供・公開すること。
- 複数データセット・複数タスク学習が、注視行動タイプにわたる耐性と一般化性能の向上に与える影響を評価すること。
提案手法
- シーンの注目度推定のためのシーンパスウェイと、3次元注視ベクトル予測のための顔パスウェイを持つ二重パスナレッジアーキテクチャを採用。
- EYEDIAPを用いた注視角度推定、改変されたGazeFollowを用いたシーン注目度、SynHeadを用いたフレーム外注視検出を同時に最適化するマルチタスク学習を採用。
- 注視の可能性マップは、注目度マップと注視ベクトルを統合することで生成され、注視がフレーム外にある場合には明示的に活性化を抑制する。
- ポーズ一般化を向上させるためにプロジェクト・アンド・コンパリゾン損失を用いるが、学習データにおけるポーズカバレッジが制限されているため、その効果は限定的である。
- 注視角度予測には交差エントロピー損失、注視度マップ予測にはL2損失を用い、エンドツーエンドでモデルを訓練。
- 最終出力は、フレーム内注視とフレーム外注視を反映した密度型の注視の可能性ヒートマップであり、解釈可能な注視推定を可能にする。
実験結果
リサーチクエスチョン
- RQ1統一された深層学習モデルは、フレーム外注視を含む多様な自然的注視行動において、視覚的注意を効果的に推定できるか?
- RQ2注視方向とシーン注目度の共同モデリングは、単一タスクアプローチと比較して、一般化された注意推定性能をどのように向上させるか?
- RQ3複数データセット・複数タスク学習は、注視および注意推定における一般化と耐性にどのような影響を与えるか?
- RQ4既存のデータセットは、一般化された視覚的注意推定という新しいタスクをサポートするためにどの程度拡張可能か?
- RQ5アーキテクチャの選択と損失関数の影響は、フレーム外注視ターゲットの検出能力にどの程度及ぶか?
主な発見
- MMDBデータセットを用いた新しい一般化された注視予測タスクにおいて、モデルは最先端の平均適合率0.902を達成し、ベースライン手法を顕著に上回った。
- GazeFollowベンチマークではAUCが0.896を達成し、フレーム内注視・注目度推定において優れた性能を示した。
- EYEDIAPおよびSynHeadデータセットを統合的に学習させることで性能が向上し、GazeFollowとEYEDIAPでの学習では平均適合率0.820、全データセットでの学習では0.902を達成した。
- 定性的な結果から、注視がフレーム外にある場合には注視の可能性マップが効果的に抑制されていることが示された。MMDBでの結果では、フレーム外ターゲットではヒートマップの値が低かった。
- EYEDIAPまたはSynHeadデータセットを除外しても注視度推定に顕著な影響はなかったが、アーキテクチャの選択、特に二重パスウェイをROIプーリングに置き換えた場合、性能が著しく低下(AUCが0.700に低下)した。
- プロジェクト・アンド・コンパリゾン損失は限定的な効果しか示さなかった。これは、SynHeadおよびEYEDIAPデータセットにおけるポーズの多様性がGazeFollowに比べて制限されているためと推測される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。