Skip to main content
QUICK REVIEW

[논문 리뷰] What Catches the Eye? Visualizing and Understanding Deep Saliency Models

Sen He, Ali Borji|arXiv (Cornell University)|2018. 03. 15.
Visual Attention and Saliency Detection참고 문헌 25인용 수 12
한 줄 요약

이 논문은 단순한 딥 샐리언시 모델을 제안하며, 잔차 유사 디코더와 픽셀 단위의 고정된 주목 예측을 위한 새로운 지수 절대 거리(EAD) 손실 함수를 사용하여 최신 기술 수준의 성능을 달성한다. 또한 고성능 모델이 특히 동물과 신체 부위와 같은 의미적 특징을 학습함을 보여주는 시각화 방법을 도입하여, 인간의 주목이 저수준의 자극을 초월해 고수준의 의미적 지식을 포함한다는 것을 시사한다.

ABSTRACT

Deep convolutional neural networks have demonstrated high performances for fixation prediction in recent years. How they achieve this, however, is less explored and they remain to be black box models. Here, we attempt to shed light on the internal structure of deep saliency models and study what features they extract for fixation prediction. Specifically, we use a simple yet powerful architecture, consisting of only one CNN and a single resolution input, combined with a new loss function for pixel-wise fixation prediction during free viewing of natural scenes. We show that our simple method is on par or better than state-of-the-art complicated saliency models. Furthermore, we propose a method, related to saliency model evaluation metrics, to visualize deep models for fixation prediction. Our method reveals the inner representations of deep models for fixation prediction and provides evidence that saliency, as experienced by humans, is likely to involve high-level semantic knowledge in addition to low-level perceptual cues. Our results can be useful to measure the gap between current saliency models and the human inter-observer model and to build new models to close this gap.

연구 동기 및 목표

  • 딥 샐리언시 모델이 수작업으로 설계된 특징에 기반한 전통적 모델보다 우수한 성능을 내는 이유를 이해하는 것.
  • 딥 모델이 주목 예측을 위해 의미적 지식을 학습하는지, 아니면 단지 저수준의 인지적 자극에 의존하는지 조사하는 것.
  • 딥 샐리언시 모델의 내부 표현을 시각화하고 해석할 수 있는 방법을 개발하는 것.
  • 딥 샐리언시 모델과 인간 간의 주목 패턴 간 격차를 정량화하는 것.
  • 모델 성능이 인간의 시선을 예측할 수 있는 활성화 맵 비율과 관련이 있는지 평가하는 것.

제안 방법

  • 단일 해상도 입력을 사용하고 GAN 학습 없이도 작동하는 단순한 완전 컨volution형 인코더-디코더 아키텍처를 제안하며, 디코더는 잔차 구조를 따름.
  • 기존 손실 함수인 BCE와 바타차리야 거리보다 우수한 성능을 보이는 새로운 픽셀 단위의 손실 함수인 지수 절대 거리(EAD)를 도입.
  • 인간의 주목 지점을 예측하는 데 기여하는 활성화 맵을 식별하기 위한 새로운 시각화 기법을 개발함(이를 '긍정적 주목 검출기'라고 지칭함).
  • 정규화된 평균 검출 빈도 $ f_n(c) = f_d(c)/f_t(c) $ 를 사용하여 긍정적 주목 검출기가 어떤 시각적 클래스나 부분에 민감한지 분석함.
  • SALICON과 Broden 등의 데이터셋에서 다양한 모델(제안 모델, SalGAN, Deepnet, OpenSalicon)에 이 방법을 적용함.
  • 모델 별로 긍정적 주목 검출기의 비율을 정량화하고, NSS와 같은 성능 지표와 상관관계를 분석함.

실험 결과

연구 질문

  • RQ1딥 샐리언시 모델이 고성능 주목 예측 성능을 내는 데 기여하는 시각적 패턴은 무엇인가?
  • RQ2딥 샐리언시 모델이 주목 예측을 위해 의미적 지식(예: 물체 카테고리, 신체 부위)을 얼마나 활용하는가, 저수준의 인지적 자극에 얼마나 의존하는가?
  • RQ3인간의 시선을 예측할 수 있는 활성화 맵의 비율이 전체 모델 성능과 어떻게 관련이 있는가?
  • RQ4딥 샐리언시 모델의 내부 표현을 시각화하고 해석하여 의사결정 과정을 이해할 수 있는가?
  • RQ5ImageNet에서 미리 학습된 특징을 사용해 훈련한 모델이 초기화 없이 훈련한 모델보다 더 의미적으로 유의미한 주목 검출기를 학습하는가?

주요 결과

  • EAD 손실 함수를 사용하는 제안된 단순한 모델이 Deepfix나 SalGAN과 같은 복잡한 아키텍처를 능가하는 최신 기술 수준의 성능을 달성함.
  • 이 모델은 NSS 점수 2.21을 기록하여 평가된 모든 모델 중에서 가장 높으며, 긍정적 주목 검출기 비율(4.1%)도 가장 높음.
  • 모델 성능(NSS로 측정)과 인간의 시선을 예측할 수 있는 활성화 맵 비율 간에 강한 정적 상관관계(r = 0.94)가 존재함.
  • 긍정적 주목 검출기는 주로 동물(개, 고양이, 소), 사람, 신체 부위(머리, 머리카락, 목)와 같은 의미적 카테고리에 민감함을 보여주며, 고수준의 의미적 인코딩이 이루어지고 있음을 시사함.
  • ImageNet에서 미리 학습된 모델(SalGAN, Salicon)은 일반적인 동물에 대해 더 높은 검출 빈도를 보였고, 초기화 없이 훈련한 모델(Deepnet)은 더 많은 인공 구조물(예: 건물, 차량)을 탐지함.
  • 분석 결과, 비예측성 뉴런에는 명확한 음성 중심 편향(negative central bias)이 존재함을 확인하여, 일부 네트워크 유닛이 샐리언시와 무관한 공간 사전 지식을 인코딩하고 있음을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.