Skip to main content
QUICK REVIEW

[논문 리뷰] Do humans and Convolutional Neural Networks attend to similar areas during scene classification: Effects of task and image type

Romy Müller, Marcel Dürschmidt|arXiv (Cornell University)|2023. 07. 25.
Face Recognition and PerceptionNeuroscience참고 문헌 70인용 수 3
한 줄 요약

이 연구는 시나리오 분류 과정에서 인간과 컨볼루션 신경망(CNN)의 주의 집중 방식이 작업 유형과 이미지 콘텐츠에 따라 어떻게 달라지는지 조사한다. 물체, 실내 풍경, 풍경 이미지에서 눈동자 추적과 수동 선택을 통해 수행한 연구에서, 인간의 작업 의도성이 CNN과의 주의 집중 유사도에 상당한 영향을 미치는 것으로 밝혀졌다. 특히 물체의 경우 수동 선택이 CNN과 가장 유사한 반면, 풍경의 경우 모든 작업에서 유사도가 낮게 유지된다.

ABSTRACT

Deep Learning models like Convolutional Neural Networks (CNN) are powerful image classifiers, but what factors determine whether they attend to similar image areas as humans do? While previous studies have focused on technological factors, little is known about the role of factors that affect human attention. In the present study, we investigated how the tasks used to elicit human attention maps interact with image characteristics in modulating the similarity between humans and CNN. We varied the intentionality of human tasks, ranging from spontaneous gaze during categorization over intentional gaze-pointing up to manual area selection. Moreover, we varied the type of image to be categorized, using either singular, salient objects, indoor scenes consisting of object arrangements, or landscapes without distinct objects defining the category. The human attention maps generated in this way were compared to the CNN attention maps revealed by explainable artificial intelligence (Grad-CAM). The influence of human tasks strongly depended on image type: For objects, human manual selection produced maps that were most similar to CNN, while the specific eye movement task has little impact. For indoor scenes, spontaneous gaze produced the least similarity, while for landscapes, similarity was equally low across all human tasks. To better understand these results, we also compared the different human attention maps to each other. Our results highlight the importance of taking human factors into account when comparing the attention of humans and CNN.

연구 동기 및 목표

  • 다양한 인간 주의 집중 작업(자발적 시선, 시선 지시, 수동 선택)이 CNN과의 주의 지ap 유사도에 어떻게 영향을 미치는지 조사하기 위해.
  • 이미지 유형(물체, 실내 풍경, 풍경)이 인간과 CNN 간 주의 집중 일치 정도에 어떻게 영향을 미치는지 조사하기 위해.
  • 작업 의도성과 이미지 콘텐츠가 인간과 모델의 주의 집중 메커니즘 간 유사도에 공동으로 영향을 미치는지 평가하기 위해.
  • 다른 작업 간 인간 주의 지도를 비교하여 인간 시각 주의 집중의 작업 특화 편향을 이해하기 위해.
  • 시나리오 분류 과정에서 인간과 CNN 주의 집중이 가장 유사해지는 조건에 대한 경험적 증거를 제공하기 위해.

제안 방법

  • 이미지 분류 작업 중 자발적 눈동자 시선, 의도적 시선 지시, 수동 영역 선택을 통해 인간 주의 지도를 수집하였다.
  • 동일한 이미지 분류 작업에 대해 사전 훈련된 CNN에서 Grad-CAM을 사용해 설명 가능한 주의 지도를 생성하였다.
  • 다양한 이미지 유형에서 인간과 CNN 주의 지도 간 유사도를 유사도 지표(예: 상관관계 또는 교차 면적 비율)를 사용해 비교하였다.
  • 이미지 콘텐츠를 체계적으로 변화시켰다: 독립적인 주목할 만한 물체, 물체 배치가 있는 실내 풍경, 물체가 없는 풍경.
  • 다양한 작업 유형과 이미지 유형이 주의 집중 유사도에 미치는 영향을 다변량 비교를 통해 분석하였다.
  • 다양한 작업 간 인간 간 주의 지도 일관성을 평가하여 작업의 신뢰성과 편향을 점검하였다.

실험 결과

연구 질문

  • RQ1인간 주의 집중 작업 유형(자발적 시선, 시선 지시, 수동 선택)이 인간과 CNN 주의 지도 간 유사도에 어떻게 영향을 미치는가?
  • RQ2이미지 유형(물체, 실내 풍경, 풍경)이 인간과 CNN 간 주의 집중 일치 정도에 어떻게 영향을 미치는가?
  • RQ3다양한 이미지 유형과 작업 모odal 간 인간-CNN 주의 집중 유사도에 일관된 패턴이 존재하는가?
  • RQ4다른 작업 간 인간 주의 지도는 어떻게 상호 비교되며, 이는 주의 집중 일치 연구에 어떤 함의를 갖는가?
  • RQ5시나리오 분류 과제에서 인간의 시각 주의 집중이 CNN 주의 집중과 가장 유사해지는 조건은 무엇인가?

주요 결과

  • 단일로 주목할 만한 물체가 있는 이미지에서는 수동 영역 선택이 CNN Grad-CAM 지도와 가장 유사한 인간 주의 지도를 생성하여, 작업 유형에 따른 일치가 확인되었다.
  • 실내 풍경에서는 자발적 시선이 CNN 주의 집중과 가장 낮은 유사도를 보였으며, 이는 자연스러운 시선 패턴이 복잡한 환경에서 모델 주의 집중과 다름을 시사한다.
  • 명확한 물체가 없는 풍경의 경우, 모든 인간 작업에서 주의 집중 유사도가 낮게 유지되어, 물체 부재가 작업 유형에 관계없이 일치도를 감소시킴을 시사한다.
  • 인간 작업의 의도성이 강한 영향을 미치며, 이는 이미지 유형에 따라 달라진다: 물체 및 실내 풍경 카테고리에서는 상당한 영향을 미치지만, 풍경에서는 영향이 없었다.
  • 인간 주의 지도는 작업 간에 상당한 차이를 보였으며, 수동 선택이 관련 이미지 영역을 타겟팅하는 데 가장 높은 일관성과 정밀도를 보였다.
  • 결과적으로 인간의 요소, 즉 작업 설계와 이미지 콘텐츠가 인간과 CNN 간 주의 집중 일치 정도를 결정하는 데 핵심적인 역할을 한다는 점을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.