[論文レビュー] Learning a Saliency Evaluation Metric Using Crowdsourced Perceptual Judgments
本論文は、16名の被験者による134,400件の二項比較を含む、集団による知覚的判断に基づいて学習された、深層学習ベースのサリエンシーマップ類似度評価指標CPJを提案する。2ストリームの畳み込みニューラルネットワーク(CNN)を用いて、人間の知覚要因を学習し、合成データにおいて99.6%の正確性を達成。既存の指標と比較して、サリエンシーマップ類似度における人間の知覚と密接に一致している。
In the area of human fixation prediction, dozens of computational saliency models are proposed to reveal certain saliency characteristics under different assumptions and definitions. As a result, saliency model benchmarking often requires several evaluation metrics to simultaneously assess saliency models from multiple perspectives. However, most computational metrics are not designed to directly measure the perceptual similarity of saliency maps so that the evaluation results may be sometimes inconsistent with the subjective impression. To address this problem, this paper first conducts extensive subjective tests to find out how the visual similarities between saliency maps are perceived by humans. Based on the crowdsourced data collected in these tests, we conclude several key factors in assessing saliency maps and quantize the performance of existing metrics. Inspired by these factors, we propose to learn a saliency evaluation metric based on a two-stream convolutional neural network using crowdsourced perceptual judgements. Specifically, the relative saliency score of each pair from the crowdsourced data is utilized to regularize the network during the training process. By capturing the key factors shared by various subjects in comparing saliency maps, the learned metric better aligns with human perception of saliency maps, making it a good complement to the existing metrics. Experimental results validate that the learned metric can be generalized to the comparisons of saliency maps from new images, new datasets, new models and synthetic data. Due to the effectiveness of the learned metric, it also can be used to facilitate the development of new models for fixation prediction.
研究の動機と目的
- サリエンシーマップ類似度評価における計算的指標と人間の知覚のギャップを解消すること。
- 広範な集団による主観的テストを通じて、人間のサリエンシーマップ類似度判断に影響を与える主要な知覚要因を同定すること。
- 統計的または情報理論的測定に依存するのではなく、人間の知覚的判断から学習する新しい評価指標を開発すること。
- 新規の画像、データセット、モデル、合成データに対しても一般化できる指標を構築し、既存の指標の補完とすること。
提案手法
- 16名の被験者を対象に大規模な集団による知覚的判断タスクを実施。推定サリエンシーマップ(ESM)のペアと、正解マップ(GSM)をヒストограм等化で可視化して提示する。
- 134,400件の二項アノテーションを収集し、GSMにより類似していると判断されたESMを特定する。これにより、相対的な知覚的好みのデータセットが構築される。
- 2つのESMとGSMを入力として受け取り、どちらのESMがGSMよりも知覚的に類似しているかを予測する、2ストリームの畳み込みニューラルネットワーク(CPJ)を設計する。
- 相対的な知覚的判断に基づいてコントラスト損失を用いてCPJを訓練し、人間がより類似性が高いと判断したESMに高いスコアを割り当てるようネットワークを促進する。
- 同じ集団によるデータを用いて、既存の指標の性能を定量的に評価し、CPJを最先端の指標と比較するベンチマークを構築する。
- 未観測のデータ、すなわち新規の画像、データセット、モデル(例:HFT、SP)、および合成データを用いてCPJを検証し、一般化性能とロバストネスを評価する。
実験結果
リサーチクエスチョン
- RQ1人間は、サリエンシーマップの類似度を判断する際に、一貫してどのような知覚的要因を利用しているのか?
- RQ2集団による知覚的判断から学習した深層学習モデルは、新規の画像、データセット、モデルに一般化できるか?
- RQ3人間の知覚に基づいて学習した指標は、従来の計算的指標よりもサリエンシーマップ類似度評価において優れているか?
- RQ4合成データを含む多様なサリエンシーマップペアにおいて、学習された指標CPJは人間の知覚とどの程度一致しているか?
主な発見
- 合成データのテストにおいて、CPJは正解のサリエンシーマップが合成ESMよりも類似度が高いと正しく識別する正確性が99.6%に達し、人間の知覚と強い一致を示している。
- 正解がすべての他のものより優れていると予想される合成データにおいて、CPJは99.6%の正確性を達成しており、上界性能を正しく捉えられることを確認している。
- ランダムベースライン(下界)に対しては94.3%の正確性を達成しており、正しい選択肢が明確でない状況でも一貫した性能を示している。
- CPJは、新規の画像、新規のデータセット、新規のモデル(例:HFT、SP)、および合成データに対しても、効果的に一般化しており、10の代表的既存指標を上回っている。
- 最も優れた既存指標でさえ、人間の判断に一致する正確性が72.8%にとどまり、CPJがその大きなギャップを埋めていることが浮き彫りになっている。
- CNNベースのフレームワークは16名の被験者間で共通する知覚的要因を効果的に学習できており、強固で知覚に整合した評価指標を実現し、従来の指標の補完として機能している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。