Skip to main content
QUICK REVIEW

[논문 리뷰] Human perception in computer vision

Ron Dekel|arXiv (Cornell University)|2017. 01. 17.
Visual Attention and Saliency Detection참고 문헌 47인용 수 4
한 줄 요약

이 논문은 ImageNet으로 훈련된 딥 네ural 네트워크(DNNs)가 인간 시각 인지의 계산적 특성과 관련이 있는지 조사한다. 이를 위해 DNN 활성화 변화를 심리물리적 측정된 인지 민감도와 비교한다. 연구 결과, 중간 수준의 DNN 레이어는 이미지 변화에 대한 민감도와 관련이 있으며, 후기 레이어는 분할, 둘레 효과(crowding), 형태 인식과 관련이 있음을 발견하였다. 이는 서로 다른 아키텍처를 가진 DNN과 인간의 일반적인 시각 계산이 유사한 최적의 해법으로 수렴할 수 있음을 시사한다.

ABSTRACT

Computer vision has made remarkable progress in recent years. Deep neural network (DNN) models optimized to identify objects in images exhibit unprecedented task-trained accuracy and, remarkably, some generalization ability: new visual problems can now be solved more easily based on previous learning. Biological vision (learned in life and through evolution) is also accurate and general-purpose. Is it possible that these different learning regimes converge to similar problem-dependent optimal computations? We therefore asked whether the human system-level computation of visual perception has DNN correlates and considered several anecdotal test cases. We found that perceptual sensitivity to image changes has DNN mid-computation correlates, while sensitivity to segmentation, crowding and shape has DNN end-computation correlates. Our results quantify the applicability of using DNN computation to estimate perceptual loss, and are consistent with the fascinating theoretical view that properties of human perception are a consequence of architecture-independent visual learning.

연구 동기 및 목표

  • ImageNet으로 훈련된 딥 네ural 네트워크(DNNs)의 계산 과정이 인간 시각 인지와 관련이 있는지 조사하는 것.
  • 이미지 변화, 분할, 둘레 효과(crowding), 형태에 대한 인지 민감도가 DNN 처리의 어느 단계에서 가장 강하게 반영되는지 규명하는 것.
  • 과제 난이도나 분류 일致성과 무관하게 DNN 표현이 인간 심리물리적 반응을 예측 모델로 사용할 수 있는지 평가하는 것.
  • DNN이 뇌 기능 모델링 및 이미지 처리에서 인지 손실 지표를 설계하는 데 도구로 활용될 잠재력을 평가하는 것.

제안 방법

  • 연구는 1,080개의 이미지와 다양한 노이즈 편향을 가진 제어된 심리물리적 데이터셋(Local Image Masking Database)을 사용하여 인간의 이미지 변화에 대한 인지 민감도를 측정한다.
  • ImageNet으로 훈련된 DNNs(AlexNet, VGG 등)를 활용하여 평균 절대 활성도 차이와 상호정보량을 통해 각 레이어 간 표현 변화를 계산한다.
  • 각 레이어에서 인간 인지 민감도와 DNN 활성도 변화를 정량적으로 비교하여 인간 인지에 가장 잘 예측하는 레이어를 식별한다.
  • 분할, 둘레 효과(crowding), 형태 등과 같은 인지 현상에 초점을 맞춘 분석을 수행한다.
  • 간단하고 비자연스러운 자극을 사용하여 과제 특유의 혼란 요소를 제거하고, 카테고리 간 유사한 난이도를 확보한다.
  • 예측 성능 평가를 위해 DNN 기반 인지 지표를 단순한 이미지 통계와 상세한 심리물리 모델과 비교한다.

실험 결과

연구 질문

  • RQ1다양한 레이어에서의 딥 네ural 네트워크 계산이 인간의 이미지 변화에 대한 인지 민감도와 관련이 있는가?
  • RQ2분할, 둘레 효과(crowding), 형태와 같은 복잡한 시각 현상에 대해 인간의 인지가 가장 잘 예측되는 DNN 레이어는 어디인가?
  • RQ3DNN 표현이 대비 일관성과 밴드패스 필터링과 같은 인지 메커니즘을 어느 정도 반영하는가?
  • RQ4과제 특유의 편향 없이 DNN 기반 표현이 인간 시각 인지의 정확하고 일반적인 모델로 사용될 수 있는가?
  • RQ5DNN의 예측 성능가 장기적인 이미지 통계와 상세한 인지 모델에 비해 인지 손실 추정에 있어 어떻게 비교되는가?

주요 결과

  • 이미지 변화에 대한 인지 민감도는 중간 수준의 DNN 레이어의 활성도 변화와 강하게 상관되며, 이는 이러한 레이어가 맥락 의존적 시각적 두드러짐을 포착하고 있음을 시사한다.
  • 분할, 둘레 효과(crowding), 형태와 같은 게슈탈 현상에 대한 민감도는 후기 단계의 DNN 계산과 가장 강하게 상관되며, 이는 네트워크의 끝부분 표현이 체계 수준의 인지 처리를 반영하고 있음을 시사한다.
  • 초기 레이어에서의 밴드패스 필터링과 이후 레이어에서의 보정을 포함하는 대비 일관성은 DNN 계산에도 반영되며, 인간 시각 전도 과정과 일치한다.
  • DNN 기반 인지 지표는 단순한 이미지 통계를 뛰어나며, 상세한 심리물리 모델의 성능과도 유사하게 인간의 인지 반응을 예측한다.
  • 결과적으로, 서로 다른 아키텍처를 가진 DNN과 생물학적 시스템 간의 일반적인 시각 계산이 유사한 최적의 해법으로 수렴할 수 있다는 이론적 관점에 대한 지원을 제공한다.
  • 3D 구조와 대칭성과 관련된 인지 효과는 강한 DNN 관련성이 없음을 보여, 피드포워드 DNN이 특정 고차원 인지 현상을 모델링하는 데에는 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.