Skip to main content
QUICK REVIEW

[論文レビュー] Saccade Sequence Prediction: Beyond Static Saliency Maps

Calden Wloka, Iuliia Kotseruba|arXiv (Cornell University)|Nov 29, 2017
Visual Attention and Saliency Detection参考文献 46被引用数 7
ひとこと要約

本稿では、中心視と周辺視の注意喚起性を統合し、網膜の非均一性をモデル化することで、時間的に順序付けられた移動注視(サッカード)シーケンスを予測する深層学習ベースの注視制御モデル、STAR-FCを提案する。CAT2000データセットにおいて、最初の5回の注視において、人間の被験者間ばらつきと同等の注視シーケンスの整合性を達成し、静的注意喚起マップを上回る性能を示した。

ABSTRACT

Visual attention is a field with a considerable history, with eye movement control and prediction forming an important subfield. Fixation modeling in the past decades has been largely dominated computationally by a number of highly influential bottom-up saliency models, such as the Itti-Koch-Niebur model. The accuracy of such models has dramatically increased recently due to deep learning. However, on static images the emphasis of these models has largely been based on non-ordered prediction of fixations through a saliency map. Very few implemented models can generate temporally ordered human-like sequences of saccades beyond an initial fixation point. Towards addressing these shortcomings we present STAR-FC, a novel multi-saccade generator based on a central/peripheral integration of deep learning-based saliency and lower-level feature-based saliency. We have evaluated our model using the CAT2000 database, successfully predicting human patterns of fixation with equivalent accuracy and quality compared to what can be achieved by using one human sequence to predict another. This is a significant improvement over fixation sequences predicted by state-of-the-art saliency algorithms.

研究の動機と目的

  • 静的注意喚起マップが、注視位置の予測にとどまることで、時間的に順序付けられたサッカードシーケンスの予測に限界を示す問題に対処すること。
  • 網膜の非均一性および中心視/周辺視の視覚処理を組み込むことで、人間の注視制御をより正確にモデル化すること。
  • タスクベースの制御やトップダウン的注意に適応可能な、柔軟でパrameter調整可能なモデルを構築すること。
  • 人間の注視データと比較して、注意喚起マップの指標ではなく、シーケンス予測性能を評価することで、現実世界の視覚行動を反映すること。

提案手法

  • STAR-FCは、中心視と周辺視の視覚フィールド統合のため、深層学習ベースの注意喚起マップと低レベル特徴ベースの注意喚起を組み合わせたマルチサッカードジェネレータを用いる。
  • モデルは網膜の非均一性を明示的にモデル化しており、中心視の高解像度と周辺視の低解像度を考慮することで、空間的正確性を向上させる。
  • 注視制御ネットワークは、注意喚起値に基づいてサッカードのターゲットを選択し、再帰的注視を防ぐために帰還抑制と空間的注意メカニズムを統合する。
  • 予測されたシーケンスと人間の注視シーケンスを比較するため、CAT2000データセット上で、軌道指標(ユークリッド距離、フレシェ距離、ハウスマッハ距離)を用いてモデルを訓練および評価する。
  • 最先端の注意喚起モデル(例:LDS、GBVS、SALICON)および中央注視予測ベースラインと比較して、性能をベンチマークする。
  • タスクベースのチューニングやトップダウン的注意に適応可能なように設計されており、異なる実験条件への適応が可能である。

実験結果

リサーチクエスチョン

  • RQ1計算モデルは、静的注意喚起マップよりも、人間の注視パターンに近い時間的に順序付けられたサッカードシーケンスを生成できるか?
  • RQ2網膜の非均一性を明示的にモデル化することで、予測された注視シーケンスの整合性はどの程度向上するか?
  • RQ3中心視と周辺視の注意喚起性を統合することで、単一の注意喚起マップに依存するモデルと比較して、シーケンス予測性能はどの程度向上するか?
  • RQ4提案されたモデルの性能は、人間の被験者間ばらつきの注視シーケンスと比較して、どの程度の水準にあるか?
  • RQ5モデルは、被験者間の一貫性の異なる多様な画像カテゴリに一般化できるか?

主な発見

  • STAR-FCは、すべての3つの指標(ED、FD、HD)において、人間の被験者間比較と同等の軌道スコアを達成し、自然な人間のばらつきと一致する唯一のモデルである。
  • CAT2000データセットにおいて、STAR-FCの注視分布の平均二乗誤差は、人間被験者と同等であり、高い空間的整合性を示している。
  • LDS や GBVS などのすべてのテスト済み注意喚起モデルを上回り、人間のシーケンスとのユークリッド距離が20.6%低く、フレシェ距離が8.8%低く、ハウスマッハ距離が6.3%低かった。
  • 中央注視予測ベースラインは、CAT2000の中央注視バイアスを再現できたが、すべての指標で最悪の性能を示し、中央バイアスのみでは正確なシーケンス予測が不十分であることを証明した。
  • モデルは画像カテゴリ全体で安定した性能を示し、スケッチや低解像度画像のようなカテゴリでは高い一貫性を示し、コマーシャルや衛星画像のようなカテゴリでは一貫性が低かった—これは、先行研究の被験者間ばらつきに関する知見と一致した。
  • STAR-FCは、1人の被験者の注視シーケンスを用いて別の被験者のシーケンスを予測するのと同等の品質で注視シーケンスを予測でき、シーケンスレベルの注視予測の新しいベンチマークを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。