[論文レビュー] Invariance Analysis of Saliency Models versus Human Gaze During Scene Free Viewing
本論文は、1,900枚の歪み画像(19種類の歪みタイプ)を含む大規模な眼動追跡データベースを紹介し、画像の歪みが人間の注視行動および顕著性モデルの性能に与える影響を調査する。歪みの種類として回転やねじれは顕著性モデルの精度を著しく低下させると判明した一方で、注視を保持する歪みを用いたデータ拡張により、深層顕著性モデルの耐性が向上することが示された。
Most of current studies on human gaze and saliency modeling have used high-quality stimuli. In real world, however, captured images undergo various types of distortions during the whole acquisition, transmission, and displaying chain. Some distortion types include motion blur, lighting variations and rotation. Despite few efforts, influences of ubiquitous distortions on visual attention and saliency models have not been systematically investigated. In this paper, we first create a large-scale database including eye movements of 10 observers over 1900 images degraded by 19 types of distortions. Second, by analyzing eye movements and saliency models, we find that: a) observers look at different locations over distorted versus original images, and b) performances of saliency models are drastically hindered over distorted images, with the maximum performance drop belonging to Rotation and Shearing distortions. Finally, we investigate the effectiveness of different distortions when serving as data augmentation transformations. Experimental results verify that some useful data augmentation transformations which preserve human gaze of reference images can improve deep saliency models against distortions, while some invalid transformations which severely change human gaze will degrade the performance.
研究の動機と目的
- 自然シーンの自由視認におけるさまざまな画像歪みが人間の注視行動に与える影響を体系的・系統的に調査すること。
- 最新の顕著性モデルが歪みのある画像における注視予測を行う際の性能低下を評価すること。
- 人間の注視パターンを保持する歪みタイプを同定し、それらを用いて顕著性モデルの耐性を向上させる有効なデータ拡張として活用すること。
- 現実世界の画像劣化下での顕著性モデリングの進展を図るためのベンチマークデータセットと分析を提供すること。
- 歪み下でも人間の視覚的注視に一致するデータ拡張戦略の選定を支援すること。
提案手法
- CAT2000データセットから1,900枚の画像(100枚の基準画像 × 19種類の歪み)を用いて、一貫性を保つためにすべて1080×1920にリサイズした大規模な眼動追跡データベースを構築した。
- MATLABを用いて19種類の歪みタイプ(運動歪み、ノイズ、JPEG圧縮、コントラスト調整、回転、ねじれ、クロッピング、ミラー処理)を生成した。
- 10名の被験者を対象に、すべての歪み画像および基準画像に対して眼動追跡実験を実施し、人間の注視データを収集した。
- 4つの最先端の深層顕著性モデル(SAM-VGG、SALICON、ML-Net、SAM-ResNet)および古典的モデルを、IOスコア、sAUC、NSSという指標を用いてこのデータセット上で評価した。
- 注視シフト解析に基づき、歪みを「有効(注視パターンを保持)」と「無効(注視を著しく変化)」に分類した。
- 有効および無効な拡張データセットを用いて深層モデルを微調整し、クリアな基準画像のみで学習したモデルと性能を比較した。
実験結果
リサーチクエスチョン
- RQ1さまざまな画像歪みが、自然シーンの自由視認における人間の注視分布にどのように影響を与えるか?
- RQ2歪みのある画像における注視予測において、顕著性モデルの性能がクリアな画像と比較してどの程度低下するか?
- RQ3どの歪みタイプが人間の注視パターンを保持しており、したがって顕著性モデルの耐性を向上させる有効なデータ拡張として利用可能か?
- RQ4注視を保持する歪み画像で微調整された深層顕著性モデルは、現実世界の歪み下でも一般化性能および耐性が向上するか?
- RQ5歪みのある刺激下において、深層顕著性モデルと上限の人間の注視予測(IOスコア)との相対的な性能差はどの程度か?
主な発見
- 回転およびねじれ歪みは顕著性モデルの性能を最も著しく低下させ、IOスコアはそれぞれ0.6543および0.6804に低下したが、クリア画像では0.7335であった。
- 極端な歪み下では人間の注視が著しく変化する:回転およびねじれは主な顕著対象を変更し、低コントラスト画像は注視を中心部に引き寄せる。
- ミラー処理、コントラスト調整、JPEG1、ノイズ1などの有効なデータ拡張で学習した顕著性モデルは、クリア画像のみで学習したモデルを上回り、IOスコアが最大0.02向上した。
- 回転、運動歪み(MotionBlur2)、クロッピングなどの無効な拡張はモデル性能を低下させ、それらのセットで微調整した場合、IOスコアがベースラインを下回った。
- 手作業で特徴を設計した古典的顕著性モデルは、極端なノイズおよび低コントラスト歪み下で深層モデルよりも高い耐性を示した。
- 有効な歪みデータで微調整された深層モデルは、未知の歪み画像に対してもより良い一般化性能と高い性能を示し、注視を保持する拡張の有効性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。