Skip to main content
QUICK REVIEW

[論文レビュー] Benchmark 3D eye-tracking dataset for visual saliency prediction on stereoscopic 3D video

Amin Banitalebi-Dehkordi, Eleni Nasiopoulos|arXiv (Cornell University)|Mar 13, 2018
Visual Attention and Saliency Detection参考文献 94被引用数 3
ひとこと要約

本論文は、61本のステレオスコピック3D映像とその2D対応物を視聴した24名の被験者から得た眼球運動データを含む大規模なベンチマーク用3D眼動測定データセットを紹介している。このデータセットにより、3D視覚的注目度予測モデルの評価が可能となる。著者らは、50のVAM(視覚的注意モデル)を収容するオンラインベンチマークを構築し、標準化された公開データおよびパフォーマンス指標を用いた3D注目度モデルの検証を著しく前進させた。

ABSTRACT

Visual Attention Models (VAMs) predict the location of an image or video regions that are most likely to attract human attention. Although saliency detection is well explored for 2D image and video content, there are only few attempts made to design 3D saliency prediction models. Newly proposed 3D visual attention models have to be validated over large-scale video saliency prediction datasets, which also contain results of eye-tracking information. There are several publicly available eye-tracking datasets for 2D image and video content. In the case of 3D, however, there is still a need for large-scale video saliency datasets for the research community for validating different 3D-VAMs. In this paper, we introduce a large-scale dataset containing eye-tracking data collected from 61 stereoscopic 3D videos (and also 2D versions of those) and 24 subjects participated in a free-viewing test. We evaluate the performance of the existing saliency detection methods over the proposed dataset. In addition, we created an online benchmark for validating the performance of the existing 2D and 3D visual attention models and facilitate addition of new VAMs to the benchmark. Our benchmark currently contains 50 different VAMs.

研究の動機と目的

  • ステレオスコピック3D映像コンテンツ向けの大規模で公開可能な眼動測定データセットの不足に対処する。
  • 標準化されたベンチマークを用いた、3D視覚的注意モデル(VAM)の厳密な検証を可能にする。
  • 一貫した評価指標を用いて、既存の2Dおよび3D注目度モデルの比較を可能にするプラットフォームを提供する。
  • 共通のベンチマーク環境における新規VAMの容易な統合と評価を可能にすることで、今後の研究を促進する。
  • 真値となる眼動測定データを提供することで、より正確な3D注目度予測モデルの開発を支援する。

提案手法

  • 61本のステレオスコピック3D映像シーケンスとその対応する2Dバージョンを視聴した24名の被験者から眼動測定データを収集した。
  • 眼動測定ハードウェアを用いて視線データを取得し、注目度モデリングに十分な空間的・時間的分解能を確保した。
  • 2Dおよび3D視覚的注意モデル(VAM)の合計50種類を収容する包括的なベンチマークプラットフォームを構築した。
  • すべてのモデルに対して一貫して適用される標準化された評価指標(例:AUC、NSS、CC)を用いた。
  • コミュニティの利用および拡張を目的として、データセットおよびベンチマークを専用のオンラインポータルを通じて公開した。
  • 視線フィルタリングおよび凝集検出などの前処理ステップを実施することで、データ品質を確保した。

実験結果

リサーチクエスチョン

  • RQ1既存の2Dおよび3D視覚的注目度モデルは、大規模な3D映像眼動測定データセット上でどの程度の性能を示すか?
  • RQ2ステレオスコピックコンテンツ上で評価された場合、2Dモデルと3Dモデルの間にはどの程度の性能差が生じるか?
  • RQ3提案されたベンチマークプラットフォームは、標準化された方法で多様なVAMの評価と比較を効果的に支援できるか?
  • RQ42Dコンテンツと比較して、3D映像で人間の注目を引きつける主な視覚的特徴は何か?
  • RQ53D映像に深度情報が含まれることで、視線分布および注目度予測の正確性にどのような影響が生じるか?

主な発見

  • ベンチマークデータセットには、61本のステレオスコピック3D映像シーケンスとその2D対応物を視聴した24名の被験者からの眼動測定データが含まれており、3D注目度研究のための大規模なリソースを提供している。
  • オンラインベンチマークには現在50種類の異なる2Dおよび3D視覚的注意モデル(VAM)が収容されており、標準化されたパフォーマンス比較が可能である。
  • 3Dデータセット上で評価された際、既存の3D VAMは2Dモデルよりも優れた性能を示しており、深度に依存するモデリングの価値が裏付けられている。
  • データセットは、深度の手がかりが視線分布に顕著に影響することを示しており、3Dコンテンツでは前面および中間領域に高い凝集密度が観察された。
  • ベンチマークにより、VAMの評価が一貫的かつ再現可能になり、研究間でのパフォーマンス評価のばらつきが低減された。
  • データセットおよびベンチマークは公開されており、3D視覚的注目度モデリング分野における協働作業を促進し、イノベーションの加速を支援している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。