Skip to main content
QUICK REVIEW

[논문 리뷰] Learning a Saliency Evaluation Metric Using Crowdsourced Perceptual Judgments

Changqun Xia, Jia Li|arXiv (Cornell University)|2018. 06. 27.
Visual Attention and Saliency Detection참고 문헌 40인용 수 3
한 줄 요약

이 논문은 16명의 참가자들 사이에서 수행된 인위적 인지 평가 결과를 기반으로 한 딥러닝 기반의 색소니티 평가 지표인 CPJ를 제안한다. 134,400개의 이진 비교를 통해 인간의 인지적 요소를 학습한 이중 스트림 컨볼루션 네트워크(CPJ)는 합성 데이터에서 99.6%의 정확도를 달성하며, 기존 지표들보다 인간의 색소니티 맵 유사도 인식과 매우 밀접하게 일치한다.

ABSTRACT

In the area of human fixation prediction, dozens of computational saliency models are proposed to reveal certain saliency characteristics under different assumptions and definitions. As a result, saliency model benchmarking often requires several evaluation metrics to simultaneously assess saliency models from multiple perspectives. However, most computational metrics are not designed to directly measure the perceptual similarity of saliency maps so that the evaluation results may be sometimes inconsistent with the subjective impression. To address this problem, this paper first conducts extensive subjective tests to find out how the visual similarities between saliency maps are perceived by humans. Based on the crowdsourced data collected in these tests, we conclude several key factors in assessing saliency maps and quantize the performance of existing metrics. Inspired by these factors, we propose to learn a saliency evaluation metric based on a two-stream convolutional neural network using crowdsourced perceptual judgements. Specifically, the relative saliency score of each pair from the crowdsourced data is utilized to regularize the network during the training process. By capturing the key factors shared by various subjects in comparing saliency maps, the learned metric better aligns with human perception of saliency maps, making it a good complement to the existing metrics. Experimental results validate that the learned metric can be generalized to the comparisons of saliency maps from new images, new datasets, new models and synthetic data. Due to the effectiveness of the learned metric, it also can be used to facilitate the development of new models for fixation prediction.

연구 동기 및 목표

  • 색소니티 맵 유사도 평가의 계산적 지표와 인간의 인식 간 격차를 해소하기 위해.
  • 광범위한 인위적 주관적 테스트를 통해 인간이 색소니티 맵 유사도를 판단할 때 영향을 미치는 핵심 인지적 요소를 규명하기 위해.
  • 통계적 또는 정보 이론적 측정 기반에만 의존하는 것이 아니라 인간의 인지 평가 결과에서 학습하는 새로운 평가 지표를 개발하기 위해.
  • 기존 지표들의 보완이 될 수 있도록, 새로운 이미지, 데이터셋, 모델, 합성 데이터 등에 일반화 가능한 지표를 만들기 위해.

제안 방법

  • 16명의 참가자들을 대상으로 대규모 인위적 인지 평가 작업을 수행하며, 추정 색소니티 맵(ESM) 쌍과 기준 맵(GSM)을 히스토GRAM 등화 시각화 방식으로 제시한다.
  • GSM에 더 유사한 ESM을 선택하는 이진 애너테이션 134,400개를 수집하여 상대적 인지 선호도 데이터셋을 구축한다.
  • 두 개의 ESM과 하나의 GSM을 입력으로 받아, 어느 ESM이 GSM보다 더 인지적으로 유사한지를 예측하는 이중 스트림 컨볼루션 신경망(CPJ)을 설계한다.
  • 상대적 인지 평가 결과를 기반으로 대비 손실(contrastive loss)을 사용해 CPJ를 훈련시키며, 인간이 더 유사하다고 판단한 ESM에 더 높은 점수를 할당하도록 유도한다.
  • 기존 지표의 성능을 동일한 인위적 데이터를 기반으로 측정하여, CPJ가 최첨단 지표들과의 비교에서 성능을 평가한다.
  • 새로운 이미지, 새로운 데이터셋, 새로운 모델(HFT, SP 등) 및 합성 데이터를 포함한 검증 데이터에 대해 CPJ를 평가하여 일반화 능력과 강건성을 점검한다.

실험 결과

연구 질문

  • RQ1사람들은 색소니티 맵 유사도를 판단할 때 일관되게 어떤 인지적 요소를 사용하는가?
  • RQ2인위적 인지 평가 결과에서 학습된 딥러닝 모델은 새로운 이미지, 데이터셋, 모델에 대해 얼마나 잘 일반화되는가?
  • RQ3인간 인식 기반으로 학습된 지표는 전통적인 계산적 지표보다 색소니티 맵 유사도 평가에서 더 나은 성능을 보일 수 있는가?
  • RQ4합성 데이터를 포함한 다양한 색소니티 맵 쌍에 대해 학습된 지표 CPJ는 인간 인식과 어느 정도 일치하는가?

주요 결과

  • 합성 데이터 테스트에서 CPJ는 기준 맵이 더 유사한 것으로 간주되는 합성 ESM들 중에서 기준 맵을 정확히 식별하는 데 99.6%의 정확도를 달성하여 인간 인식과의 강력한 일치를 보여준다.
  • 기준 맵이 모든 다른 맵보다 우월할 것으로 기대되는 합성 데이터에서 CPJ는 99.6%의 정확도를 기록하며, 최상위 성능의 정확한 포착 능력을 확인한다.
  • 임의의 랜덤 베이스라인(하한선)에 비해 CPJ는 94.3%의 정확도를 기록하여, 정답 선택지가 명확하지 않은 경우에도 일관된 성능을 보여준다.
  • CPJ는 새로운 이미지, 새로운 데이터셋, 새로운 모델(HFT, SP 등) 및 합성 데이터에 대해 효과적으로 일반화되며, 10개의 대표적 기존 지표들을 모두 능가한다.
  • 기존 지표 중 최고 성능을 보인 지표도 인간 판단과 일치하는 데서 72.8%의 정확도에 머물러 있어, CPJ가 해소한 격차의 크기를 확인할 수 있다.
  • CNN 기반 프레임워크는 16명의 참가자들 간 공통된 인지적 요소를 효과적으로 학습하여, 전통적 지표들의 보완이 되는 강력하고 인지 인식에 기반한 평가 지표를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.