Skip to main content
QUICK REVIEW

[논문 리뷰] Passive Attention in Artificial Neural Networks Predicts Human Visual Selectivity

Thomas A. Langlois, He Zhao|arXiv (Cornell University)|2021. 07. 14.
Visual Attention and Saliency Detection참고 문헌 43인용 수 4
한 줄 요약

이 연구는 단순한 아키텍처에서 유도 백프로파게이션을 통해 유도된 피드백을 활용한 인공신경망(ANN)의 수동 주의 메커니즘이 여섯 가지 행동 과제에서 인간의 시각적 선택성을 예측함을 보여준다. ANN 주의맵과 인간 주의 간 강한 상관관계를 보이며, 인식 실험을 통해 인과관계를 검증하였고, ANN 기반 및 인간 기반 마스크가 분류 성능을 향상시켰다.

ABSTRACT

Developments in machine learning interpretability techniques over the past decade have provided new tools to observe the image regions that are most informative for classification and localization in artificial neural networks (ANNs). Are the same regions similarly informative to human observers? Using data from 79 new experiments and 7,810 participants, we show that passive attention techniques reveal a significant overlap with human visual selectivity estimates derived from 6 distinct behavioral tasks including visual discrimination, spatial localization, recognizability, free-viewing, cued-object search, and saliency search fixations. We find that input visualizations derived from relatively simple ANN architectures probed using guided backpropagation methods are the best predictors of a shared component in the joint variability of the human measures. We validate these correlational results with causal manipulations using recognition experiments. We show that images masked with ANN attention maps were easier for humans to classify than control masks in a speeded recognition experiment. Similarly, we find that recognition performance in the same ANN models was likewise influenced by masking input images using human visual selectivity maps. This work contributes a new approach to evaluating the biological and psychological validity of leading ANNs as models of human vision: by examining their similarities and differences in terms of their visual selectivity to the information contained in images.

연구 동기 및 목표

  • 수동 주의 메커니즘이 다양한 행동 과제에서 인간의 시각적 선택성을 예측하는지 평가하는 것.
  • 다양한 ANN 해석 기법의 예측 능력을 인간의 시각적 주의를 측정하는 여러 행동적 지표와 비교하는 것.
  • 인정 실험을 통해 ANN 주의와 인간의 시각적 선택성 간 상관관계를 인과관계적으로 검증하는 것.
  • 다양한 행동 측정법(예: 식별, 국소화, 인식 가능성)이 서로 다른 시각적 정보를 캡처하며, ANN 주의와의 일치 정도가 어떻게 달라지는지 평가하는 것.

제안 방법

  • 시각적 식별, 공간적 국소화, 인식 가능성, 자유시선, 자극 유도 물체 탐색, 자극성 분석 고정점 등 여섯 가지 행동 과제를 수행한 7,910명의 참가자로부터 데이터를 수집함.
  • 10종의 다른 ANN 아키텍처에서 분류에 가장 영향을 미치는 시각적 영역을 추출하기 위해 수동 주의 기법—특히 유도 백프로파게이션(SGBP)—를 적용함.
  • ANN 주의맵과 인간 행동 맵 간의 정렬을 위해 학습된 파rameter σ를 사용한 가우시안 스무딩을 적용하였으며, 교차검증을 통해 훈련 분할에서 σ를 최적화함.
  • 상관관계 결과의 강건성을 검증하기 위해 반분 교차검증을 수행하였으며, 훈련 세트에서 σ를 피팅하고 보류된 세트에서 테스트함.
  • 인과적 영향을 테스트하기 위해 빠른 인식 실험을 수행함: ANN 주의맵과 인간의 시각적 선택성 맵을 사용해 이미지를 마스킹한 후 인간 및 모델의 분류 성능을 측정함.
  • 모든 조건에서 ANN 주의맵과 인간 행동 맵(예: 인간 PC, 패치 평가, 식별 정확도 등) 간의 피크 상관관계를 계산함.

실험 결과

연구 질문

  • RQ1ANN의 수동 주의맵이 여러 행동 과제에서 인간의 시각적 선택성을 예측하는가?
  • RQ2어느 ANN 해석 기법과 아키텍처가 인간의 시각적 주의에서 공유되는 변동성을 가장 잘 예측하는가?
  • RQ3인식 성능을 통해 보여지는 바와 같이, ANN 주의와 인간 주의 간 상관관계가 인과관계적으로 의미가 있는가?
  • RQ4다른 인간 행동 측정법(예: 식별 vs. 국소화)은 ANN 주의맵과의 일치 정도에서 어떻게 다를까?
  • RQ5다양한 데이터 분할과 스무딩 파rameter에 대해 상관관계 결과는 얼마나 강건한가?

주요 결과

  • 예를 들어 AlexNet과 같은 단순한 ANN에서 유도 백프로파게이션은 인간의 인지 맵과 가장 높은 피크 상관관계(r ≈ 0.71)를 보였으며, 다른 방법과 아키텍처보다 뛰어난 성능을 보였다.
  • 모든 여섯 가지 행동 과제에서 ANN 주의맵이 인간의 시각적 선택성을 유의미하게 예측하였으며, 인간 PC, 패치 평가, 식별 정확도 맵에서 가장 높은 상관관계를 보였다.
  • 빠른 인식 실험에서 ANN 주의맵을 사용해 마스킹한 이미지를 인간이 더 빨리 더 정확하게 분류하였으며, 제어 조건(예: 무작위 또는 자극성 기반 마스크)보다 성능 향상이 뚜렷했다.
  • 동일한 ANN에서 인간의 시각적 선택성 맵 역시 분류 성능에 유의미한 영향을 미쳤으며, 이는 双방향 일치를 확인함.
  • 반분 교차검증을 통해 강건성이 검증되었으며, 테스트 세트 맵의 피크 상관관계(r ≈ 0.71)가 훈련 세트 결과(r ≈ 0.71)와 유사했고, 100번의 랜덤 분할에서 변동성이 최소한이었다.
  • 유의미한 상호작용(F(6,176)=6.54, p < 0.001)이 관찰되어, ANN 주의와 상관관계가 높은 행동 맵(예: PC, 패치 평가)은 정확한 마스킹 조건과 잘못된 마스킹 조건 간 역순위 성능 차이가 더 크게 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.