Skip to main content
QUICK REVIEW

[論文レビュー] SalyPath360: Saliency and Scanpath Prediction Framework for Omnidirectional Images

Mohamed Amine Kerkouri, Marouane Tliba|arXiv (Cornell University)|Dec 31, 2021
Visual Attention and Saliency Detection参考文献 33被引用数 4
ひとこと要約

SalyPath360 は、自己注意メカニズムを備えたエンコーダデコーダネットワークと、SoftArgMax を用いた固定点予測のための補助ネットワークを用いて、オムニディレクショナル 360° イメージの注視マップとスキャンパスを同時に予測する新しい深層学習フレームワークを提案する。このフレームワークは、注視マップとスキャンパスに基づくヒートマップを、適応的で結合確率モデルを用いて融合し、Salient360! データセットにおいて注視マップ予測およびスキャンパス予測の両タスクで最先端の性能を達成した。

ABSTRACT

This paper introduces a new framework to predict visual attention of omnidirectional images. The key setup of our architecture is the simultaneous prediction of the saliency map and a corresponding scanpath for a given stimulus. The framework implements a fully encoder-decoder convolutional neural network augmented by an attention module to generate representative saliency maps. In addition, an auxiliary network is employed to generate probable viewport center fixation points through the SoftArgMax function. The latter allows to derive fixation points from feature maps. To take advantage of the scanpath prediction, an adaptive joint probability distribution model is then applied to construct the final unbiased saliency map by leveraging the encoder decoder-based saliency map and the scanpath-based saliency heatmap. The proposed framework was evaluated in terms of saliency and scanpath prediction, and the results were compared to state-of-the-art methods on Salient360! dataset. The results showed the relevance of our framework and the benefits of such architecture for further omnidirectional visual attention prediction tasks.

研究の動機と目的

  • バーチャルリアリティ(VR)コンテンツ配信の最適化と品質体験(QoE)の向上に不可欠である、オムニディレクショナル 360° イメージにおける人間の視覚的注意を予測する課題に対処すること。
  • 球面的視覚コンテンツにおける注視行動の動的性質を捉えることのできる、注視マップとスキャンパスを同時に予測する統合フレームワークの開発。
  • 学習可能な統合メカニズムを通じて、スキャンパスから得られる固定パターンと赤道付近の注視バイアスを統合し、注視マップ予測の精度を向上させること。
  • Salient360! ベンチマークデータセット上で、最先端のモデルと比較して本フレームワークの有効性を評価すること。

提案手法

  • 自己注意モジュールを内蔵したエンコーダデコーダ畳み込みニューラルネットワークが、等角投影(ERP)形式のオムニディレクショナル画像から主な注視マップを生成する。
  • 補助ネットワークが、特徴マップに SoftArgMax 関数を適用することで、視点中心の固定点を予測し、スキャンパスの生成を可能にする。
  • 予測されたスキャンパスをガウスフィルタで畳み込んで、スキャンパスに基づく注視ヒートマップを生成する。
  • 適応的で結合確率分布モデルが、主な注視マップ、スキャンパスに基づくヒートマップ、および赤道バイアスマップを統合し、最終的なバイアスのない注視マップ予測を生成する。
  • マルチスケール特徴と自己注意メカニズムを活用することで、球面画像理解のための表現学習を強化する。
  • 標準的な指標(AUC-Judd、AUC-Borji、NSS、CC、SIM、KLD)を用いて、Salient360! データセット上でモデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1統合された深層学習フレームワークは、オムニディレクショナル 360° イメージにおける注視マップとスキャンパスの両方を効果的に予測できるか?
  • RQ2スキャンパス予測と赤道バイアスの統合は、単独の注視マップモデルと比較して、注視マップの正確性をどの程度向上させるか?
  • RQ3複数の注視マップ表現の適応的統合は、ベンチマークデータセット上で既存の最先端手法をどの程度上回るか?
  • RQ4SoftArgMax を用いた補助ネットワークは、現実的で空間的に一貫性のあるスキャンパスを生成するのにどの程度寄与しているか?

主な発見

  • SalyPath360 は、Jarodzka スコアおよび NSS で、SaltiNet や PathGan などの最先端モデルを上回る最高の性能を達成した。
  • SalyPath360 は、Salient360! データセットにおいて、AUC-Judd スコア 0.8610、AUC-Borji 0.8199、NSS 1.8552 を達成し、優れた予測精度を示した。
  • 一元配置分散分析(one-way ANOVA)の結果、SalyPath360 と SaltiNet、PathGan の間で Jarodzka スコアに統計的に有意な差異(p < 0.05)が確認された。
  • 結合確率統合モジュールは性能向上に顕著な寄与を示し、最終マップ(SalyPath360)は単独の注視マップ(S)や赤道バイアスなしの統合マップを上回った。
  • スキャンパスに基づく注視マップ単体では、位置ベースの指標では高い性能を示したが、分布ベースの指標では弱い結果にとどまり、統合の必要性が浮き彫りになった。
  • 定性的な結果から、予測されたスキャンパスが注視の強い領域および赤道領域をカバーしていることが確認されたが、指標ベースの評価(Jarodzka)は視覚的な妥当性とは乖離していたことから、その指標の限界が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。