[論文レビュー] Unifying Top-down and Bottom-up Scanpath Prediction Using Transformers
本稿では、固定点の離散化を伴わずに、トップダウンおよびボトムアップの注視動画を予測する統合型のトランスフォーマー基盤モデルHAT(Human Attention Transformer)を提案する。顕微鏡的網膜シミュレーションと密度の高いヒートマップ予測を用いることで、HATはCOCO-Search18でcNSSを最大83%向上させ、ターゲットあり、ターゲットなし、自由視認の各タスクで新たな最先端性能を達成した。
Most models of visual attention aim at predicting either top-down or bottom-up control, as studied using different visual search and free-viewing tasks. In this paper we propose the Human Attention Transformer (HAT), a single model that predicts both forms of attention control. HAT uses a novel transformer-based architecture and a simplified foveated retina that collectively create a spatio-temporal awareness akin to the dynamic visual working memory of humans. HAT not only establishes a new state-of-the-art in predicting the scanpath of fixations made during target-present and target-absent visual search and ``taskless'' free viewing, but also makes human gaze behavior interpretable. Unlike previous methods that rely on a coarse grid of fixation cells and experience information loss due to fixation discretization, HAT features a sequential dense prediction architecture and outputs a dense heatmap for each fixation, thus avoiding discretizing fixations. HAT sets a new standard in computational attention, which emphasizes effectiveness, generality, and interpretability. HAT's demonstrated scope and applicability will likely inspire the development of new attention models that can better predict human behavior in various attention-demanding scenarios. Code is available at https://github.com/cvlab-stonybrook/HAT.
研究の動機と目的
- 1つのモデルでトップダウン(目的指向)およびボトムアップ(顕著性駆動)の注視動画予測を統合すること。
- 従来のモデルが固定点の離散化に起因する情報損失と精度の低下という制限を克服すること。
- 高解像度入力に適した計算効率的で密度予測可能なフレームワークを構築すること。
- 人間の視覚作業記憶のダイナミクスを反映する解釈可能な注視メカニズムを有する認知的に妥当なモデルを構築すること。
提案手法
- HATは、異なる拡散度におけるマルチスケール特徴マップを抽出するための二重ブランチCNNエンコーダを採用し、顕微鏡的網膜を模倣する。
- 学習可能な空間的・時間的・スケール埋め込みを備えたトランスフォーマー・エンコーダを用い、視覚的情報を動的に作業記憶に統合する。
- 各ステップで密度の高い固定点ヒートマップを予測することで、固定点をグリッドセルに粗く離散化するのを回避する。
- 中心視野と周辺視野の情報をそれぞれ、顕微鏡的トークンと周辺トークンで表現し、顕微鏡的トークンは以前の固定点の履歴を符号化する。
- 自己注意機構により、作業記憶からの情報集約を介して次回の固定点位置を予測する。
- ピxls単位の監視を用いてエンドツーエンドで訓練することで、高解像度かつ逐次的な注視動画予測を可能にする。
実験結果
リサーチクエスチョン
- RQ11つのディープラーニングモデルが、それぞれ別々のアーキテクチャを必要とせずに、トップダウンおよびボトムアップの注視動画を効果的に予測できるか。
- RQ2固定点の離散化を回避することで、注視動画予測モデルの精度と一般化性能にどのような影響を与えるか。
- RQ3顕微鏡的でトランスフォーマー基盤の作業記憶は、注視動画予測における時間的および空間的認識にどの程度向上をもたらすか。
- RQ4HATの注視重みは、認知的に妥当で人間の視覚記憶ダイナミクスをどの程度反映しているか。
- RQ5HATアーキテクチャのどのコンponentsが性能に最も重要であり、解釈可能性にどのように寄与しているか。
主な発見
- HATはCOCO-Search18およびCOCO-FreeViewデータセットで、ターゲットありでcNSSを83%、ターゲットなしで58%、自由視認で72%向上させ、新たな最先端性能を達成した。
- アブレーションスタディの結果、顕微鏡的トークンを削除すると性能が最も著しく低下(cIGが約41%低下)、作業記憶の維持に顕微鏡的トークンが不可欠であることが確認された。
- 空間的および時間的埋め込みは顕著な寄与を示し、それぞれ削除するとcIGが21%および14%低下し、位置とタイミングの認識の重要性が浮き彫りになった。
- モデルの注視マップは、ターゲットなし探索の後半段階で最近の固定点が支配的であることを示しており、自由視認のパターンと類似しており、認知的整合性を確認した。
- HATの密度予測アプローチは離散化損失を回避し、高解像度の注視動画予測を可能にし、粗いアクショングリッドに依存する従来手法を上回った。
- モデルは優れた一般化性能を示し、ターゲットあり、ターゲットなし、自由視認という3つの異なる注視制御レジームすべてで最先端性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。