Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Networks Trained on Natural Scenes Exhibit Gestalt Closure

Been Kim, Emily Reif|arXiv (Cornell University)|2019. 03. 04.
Visual perception and processing mechanisms참고 문헌 48인용 수 4
한 줄 요약

이 논문은 자연 이미지로 훈련된 딥 네ural 네트워크가 명시적 지도 없이도 불완전한 형태를 완전한 형태로 인식하는 '게슈탈트 폐쇄'를 자연스럽게 나타내는지 조사한다. 내부 표현 간 유사도 측정을 통해 저자들은 최신 기술의 CNN이 정렬된 가장자리 조각을 완전한 삼각형과 동일시하는 것으로 나타내어 표현 유사도를 통해 폐쇄 유사 행동을 보이며, 게슈탈트 원칙이 자연 환경의 통계적 학습에서 유추될 수 있다는 가설을 뒷받iesen다.

ABSTRACT

The Gestalt laws of perceptual organization, which describe how visual elements in an image are grouped and interpreted, have traditionally been thought of as innate despite their ecological validity. We use deep-learning methods to investigate whether natural scene statistics might be sufficient to derive the Gestalt laws. We examine the law of closure, which asserts that human visual perception tends to "close the gap" by assembling elements that can jointly be interpreted as a complete figure or object. We demonstrate that a state-of-the-art convolutional neural network, trained to classify natural images, exhibits closure on synthetic displays of edge fragments, as assessed by similarity of internal representations. This finding provides support for the hypothesis that the human perceptual system is even more elegant than the Gestaltists imagined: a single law---adaptation to the statistical structure of the environment---might suffice as fundamental.

연구 동기 및 목표

  • 자연 이미지로 훈련된 딥 네럴 네트워크가 명시적 지도 없이도 게슈탈트 폐쇄—불완전한 형태를 완전한 형태로 인식하는 것—를 어떻게 유도할 수 있는지 테스트하기.
  • 자연 환경의 통계적 구조가 인공 신경망에서 폐쇄 유사 인식을 유도하는 데 충분한지 조사하기.
  • 특수한 유전적 메커니즘이 필요한 전통적인 인지 모델에 대한 계산적 대안을 제공하기.
  • 행동 반응 모델에 의존하지 않고, 딥 네트워크 활성화 상태의 표현 유사도를 통해 폐쇄를 정량화하기.

제안 방법

  • Image넷 데이터셋을 사용해 자연 이미지를 분류하는 최신 기술의 컨volutional 신경망(CNN)을 훈련한다.
  • 합성 자극을 생성한다: 완전한 삼각형, 정렬된 가장자리 조각(폐쇄를 유도함), 산만한 조각(폐쇄를 방지함), 각각 기울기, 크기, 전체 위치가 다양하게 설정된다.
  • 일치하는 이미지 트리플(완전한, 정렬된, 산만한 조각) 간의 특징 임베딩 간 코사인 유사도를 사용해 표현 유사도를 측정한다.
  • 폐쇄 측정치 𝒞는 완전-정렬 쌍과 완전-산만 쌍 간의 유사도 차이로 정의된다: 𝒞 = s(f(𝑎𝑖), f(𝑐𝑖)) − s(f(𝑑𝑖), f(𝑐𝑖)).
  • 768개의 자극 트리플에 대해 평균 폐쇄 𝒞̄를 계산하며, 완전한 형태와 조각 쌍 간에 동일한 픽셀 수준의 겹침을 보장하는 조건이 적용된다.
  • 코사인 유사도 함수를 사용한다: s(x,y) = (x⋅y^T)/(|x||y|), 영벡터 처리에 특별한 조치를 취한다.

실험 결과

연구 질문

  • RQ1자연 이미지로 훈련된 딥 네럴 네트워크가 명시적 지도나 유전적 메커니즘 없이도 게슈탈트 폐쇄를 나타낼 수 있는가?
  • RQ2자연 환경의 통계적 구조가 인공 신경망에서 폐쇄 유사 인식을 유도하는 데 충분한가?
  • RQ3딥 네트워크의 표현 유사도는 인간의 인지적 군집화 방식과 유사한 폐쇄 작업에서 관찰되는가?
  • RQ4행동 반응 모델에 의존하지 않고 내부 표현을 통해 폐쇄를 정량화할 수 있는가?

주요 결과

  • 평균 폐쇄 측정치 𝒞̄는 유의미하게 양수였으며, 이는 네트워크의 내부 표현이 정렬된 조각을 산만한 조각보다 완전한 삼각형과 더 유사하게 처리한다는 것을 시사한다.
  • 완전한 삼각형과 정렬된 조각에 대한 네트워크 표현은 임베딩 공간에서 거의 동일했으며, 이는 인지적 동치성을 시사한다.
  • 폐쇄 측정치는 +1에 가까운 값을 보이며, 이는 완전한 자극과 정렬된 자극 간 강한 표현 유사도를 나타내며, 게슈탈트 폐쇄와 일치한다.
  • 네트워크는 유의미한 음수 폐쇄 값이 없었으며, 이는 인지적 군집화의 뒤집힘 없이도 효과가 유지되었고, 크기, 기울기, 전체 위치의 다양성에 대해 강건함을 보였다.
  • 결과는 게슈탈트 원칙, 특히 폐쇄가 선천적이지 않고 자연 환경의 통계적 학습에서 유도될 수 있다는 것을 시사한다.
  • 이러한 발견은 단일 원칙—환경 통계에 대한 적응—이 폐쇄를 포함한 여러 게슈탈트 법칙을 뒷받침할 수 있다는 가설을 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.