Skip to main content
QUICK REVIEW

[논문 리뷰] Invariance Analysis of Saliency Models versus Human Gaze During Scene Free Viewing

Zhaohui Che, Ali Borji|arXiv (Cornell University)|2018. 10. 10.
Visual Attention and Saliency Detection참고 문헌 30인용 수 6
한 줄 요약

이 논문은 인간의 시선과 색채 모델 성능에 미치는 영향을 연구하기 위해 1,900장의 왜곡된 이미지(19종류의 왜곡 유형)를 포함하는 대규모 눈동자 추적 데이터베이스를 소개한다. 연구 결과, 기울임과 기울임 왜곡과 같은 왜곡은 색채 모델 정확도를 크게 떨어뜨리는 반면, 눈동자 유지 왜곡을 사용한 데이터 증강은 딥 색채 모델의 강건성을 향상시킨다.

ABSTRACT

Most of current studies on human gaze and saliency modeling have used high-quality stimuli. In real world, however, captured images undergo various types of distortions during the whole acquisition, transmission, and displaying chain. Some distortion types include motion blur, lighting variations and rotation. Despite few efforts, influences of ubiquitous distortions on visual attention and saliency models have not been systematically investigated. In this paper, we first create a large-scale database including eye movements of 10 observers over 1900 images degraded by 19 types of distortions. Second, by analyzing eye movements and saliency models, we find that: a) observers look at different locations over distorted versus original images, and b) performances of saliency models are drastically hindered over distorted images, with the maximum performance drop belonging to Rotation and Shearing distortions. Finally, we investigate the effectiveness of different distortions when serving as data augmentation transformations. Experimental results verify that some useful data augmentation transformations which preserve human gaze of reference images can improve deep saliency models against distortions, while some invalid transformations which severely change human gaze will degrade the performance.

연구 동기 및 목표

  • 자연 풍경을 자유롭게 시각화할 때 다양한 이미지 왜곡이 인간의 시선 행동에 미치는 영향을 체계적으로 조사하기 위해.
  • 최신 색채 모델이 왜곡된 이미지에서의 고정점 예측 성능이 얼마나 떨어지는지 평가하기 위해.
  • 인간의 시선 패턴을 유지하는 왜곡 유형을 식별하여, 모델의 강건성을 향상시키기 위한 효과적인 데이터 증강으로 활용할 수 있도록 하기 위해.
  • 실제 세계의 이미지 열화 조건에서 색채 모델링을 발전시키기 위한 기준 데이터셋과 분석을 제공하기 위해.
  • 왜곡 조건 하에서 인간 시각 주의와 일치하는 데이터 증강 전략을 선택하는 데 도움을 주기 위해.

제안 방법

  • CAT2000 데이터셋에서 유사한 크기의 1,900장의 이미지(100장의 기준 이미지 × 19종류의 왜곡)를 사용하여 일관성을 확보하기 위해 모두 1080×1920로 리사이징한 대규모 눈동자 추적 데이터베이스를 구축하였다.
  • MATLAB을 사용하여 운동 블러, 노이즈, JPEG 압축, 대trast 조정, 회전, 기울임, 자르기, 반사 등 총 19종류의 왜곡 유형을 생성하였다.
  • 10명의 관찰자가 모든 왜곡된 이미지와 기준 이미지를 대상으로 눈동자 추적 실험을 수행하여 인간의 고정점 데이터를 수집하였다.
  • IO 스코어, sAUC, NSS를 사용하여 최신 딥 색채 모델 4종(SAM-VGG, SALICON, ML-Net, SAM-ResNet)과 고전적 모델을 평가하였다.
  • 눈동자 이동 분석을 기반으로 왜곡을 '유효한'(시선 패턴을 유지함)과 '무효한'(시선을 크게 변화시킴)으로 분류하였다.
  • 유효 및 무효 증강 세트를 모두 사용하여 딥 모델을 미세조정하고, 청소년 기준 이미지로만 훈련된 모델과 성능을 비교하였다.

실험 결과

연구 질문

  • RQ1자연 풍경을 자유롭게 시각화할 때 다양한 이미지 왜곡이 인간의 시선 분포에 어떤 영향을 미치는가?
  • RQ2청소 이미지 대비 왜곡된 이미지에서 고정점을 예측할 때 색채 모델의 성능이 얼마나 떨어지는가?
  • RQ3인간의 시선 패턴을 유지하는 왜곡 유형은 무엇이며, 따라서 색채 모델의 강건성을 향상시키기 위한 효과적인 데이터 증강으로 사용될 수 있는가?
  • RQ4눈동자 유지 왜곡 이미지로 딥 색채 모델을 미세조정하면 실제 세계의 왜곡 조건 하에서 일반화 능력과 강건성이 향상되는가?
  • RQ5왜곡된 자극에서 딥 색채 모델과 상한계 인간 시선 예측(IO 스코어) 간의 상대적 성능 격차는 얼마인가?

주요 결과

  • 회전과 기울임 왜곡은 색채 모델의 성능을 가장 크게 떨어뜨리며, IO 스코어가 각각 0.6543과 0.6804로 청소년 이미지의 0.7335보다 낮아진다.
  • 극한의 왜곡 조건에서 인간의 시선 이동이 뚜렷하게 발생한다: 회전과 기울임은 주요 색채 객체를 변화시키며, 저대trast 이미지는 중심부를 향해 시선을 집중시킨다.
  • 반사, 대trast 조정, JPEG1, 노이즈1 등의 유효한 데이터 증강을 사용해 훈련한 색채 모델은 청소년 이미지로만 훈련된 모델보다 성능이 뛰어나며, IO 스코어가 최대 0.02 향상된다.
  • 회전, 운동 블러(MotionBlur2), 자르기 등의 무효 증강은 모델 성능을 떨어뜨리며, 이러한 세트로 미세조정했을 때 IO 스코어가 기준선 이하로 떨어진다.
  • 수작업 특징을 사용하는 고전적 색채 모델은 극한의 노이즈와 저대trast 왜곡 조건에서 딥 모델보다 더 강건한 성능을 보인다.
  • 유효한 왜곡된 데이터로 딥 모델을 미세조정하면, 새로운 왜곡된 자극에 대한 일반화 능력과 성능이 향상되어 눈동자 유지 증강의 효과를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.