Skip to main content
QUICK REVIEW

[논문 리뷰] How to represent part-whole hierarchies in a neural network

Geoffrey E. Hinton|arXiv (Cornell University)|2021. 02. 25.
Neural Networks and Applications인용 수 11
한 줄 요약

이 논문은 이미지 내 부분-전체 계층을 공간 위치 간 동일한 임베딩 벡터 집합(이격된 영역)을 통해 표현하는 신경망 아키텍처인 GLOM을 제안한다. 이는 동적 가중치 할당 없이도 동적 파싱을 가능하게 한다. 트랜스포머, 캡슐, 신경장, 대비 학습을 결합함으로써 반복적인 하향식, 상향식, 횡방향 주의 메커니즘을 통해 안정적이고 시점 불변 표현을 형성하며, 시각 표현의 해석 가능성은 크게 향상시킨다.

ABSTRACT

This paper does not describe a working system. Instead, it presents a single idea about representation which allows advances made by several different groups to be combined into an imaginary system called GLOM. The advances include transformers, neural fields, contrastive representation learning, distillation and capsules. GLOM answers the question: How can a neural network with a fixed architecture parse an image into a part-whole hierarchy which has a different structure for each image? The idea is simply to use islands of identical vectors to represent the nodes in the parse tree. If GLOM can be made to work, it should significantly improve the interpretability of the representations produced by transformer-like systems when applied to vision or language

연구 동기 및 목표

  • 고정된 아키텍처를 가진 신경망이 입력에 따라 변화하는 다양한 구조를 가진 부분-전체 계층으로 이미지를 동적으로 파싱할 수 있도록 설계하는 것.
  • 구조적이고 구성적인 관계를 인코딩함으로써, 시각 및 언어 분야의 트랜스포머 유사 시스템의 해석 가능성을 향상시키는 것.
  • 고정된 신경 하드웨어 할당의 한계를 극복하기 위해 파싱 트리의 노드를 나타내기 위해 공유된 임베딩 벡터를 사용하는 것.
  • 지그문트 심리학의 필드 기반 인식과 기호 기반 인공지능의 구조적 기술을 연속적인 벡터 공간을 통해 통합하는 것.
  • 각 계층 수준에서 일관되고 안정적인 유사 벡터 집합 형성을 유도하는 정규화 기법을 포함한 엔드 투 엔드 훈련을 가능하게 하는 것.

제안 방법

  • 이미지 패치에서 계층적 표현을 학습하기 위해 각 컬럼에 공간적으로 국한된 자동에코더 스택을 사용하며, 모든 컬럼 간에 가중치를 공유한다.
  • 이웃한 수준의 임베딩을 예측하기 위해 하향식 및 상향식 신경망을 적용하며, 예측 결과를 지도 신호로 사용한다.
  • 동일 수준의 근접한 컬럼 간 횡방향 주의를 통해 거의 동일한 임베딩 벡터 집합(섬)을 형성한다.
  • 각 타임스텝에서 각 임베딩을 하향식 예측, 상향식 예측, 이전 임베딩, 평균화된 횡방향 이웃의 가중 평균으로 갱신한다.
  • 예측된 임베딩과 실제 임베딩 간의 일치도를 극대화하는 정규화 기법을 도입하여 안정적인 섬 형성을 유도한다.
  • 마스크된 이미지 복원과 대비 정규화를 포함한 엔드 투 엔드 훈련을 통해 계층적 구조를 학습한다.
Figure 1: Showing the bottom-up, top-down, and same level interactions among three adjacent levels of the proposed GLOM architecture for a single column . The blue and red arrows representing bottom-up and top-down interactions are implemented by two different neural networks that have several hidde
Figure 1: Showing the bottom-up, top-down, and same level interactions among three adjacent levels of the proposed GLOM architecture for a single column . The blue and red arrows representing bottom-up and top-down interactions are implemented by two different neural networks that have several hidde

실험 결과

연구 질문

  • RQ1고정된 아키텍처를 가진 신경망이 입력에 따라 변화하는 부분-전체 계층으로 이미지를 동적으로 파싱할 수 있는가?
  • RQ2동적 가중치 할당이나 명시적 포인터 구조 없이도 동일한 임베딩 벡터 집합이 파싱 트리의 노드를 표현할 수 있는가?
  • RQ3하향식 및 상향식 예측을 어떻게 활용하여 일관되고 시점 불변 표현을 형성할 수 있는가?
  • RQ4대비 정규화와 횡방향 주의가 인지적 전체를 대응하는 안정적이고 국소화된 유사 벡터 클러스터 형성을 촉진할 수 있는가?
  • RQ5GLOM과 같은 시스템이 심화 학습의 인덕티브 바이어스를 유지하면서도 기호 시스템 수준의 해석 가능성에 도달할 수 있는 정도는 어느 정도인가?

주요 결과

  • GLOM 아키텍처는 각 계층 수준에서 거의 동일한 임베딩 벡터 집합(섬)을 성공적으로 형성하며, 높은 수준에서 더 큰 섬이 형성되어 부분들이 전체로 일관되게 그룹화됨을 시사한다.
  • 횡방향 주의와 정규화된 예측 일치도를 통해 유사도 섬이 형성되며, 이는 동적 가중치 할당이나 명시적 포인터 구조가 필요로 하지 않음을 보여준다.
  • 손실 영역이 있는 이미지를 재구성할 수 있도록 엔드 투 엔드 훈련이 가능하여, 의미 있는 계층적 표현을 학습할 수 있음을 입증한다.
  • 지속적인 벡터 유사도를 사용해 계층적 관계를 인코딩함으로써, 지그문트 심리학의 필드 기반 인식과 기호 기반 구조적 기술을 통합한다.
  • 학습된 임베딩의 연속적 공간에 직접적으로 구조적 기술을 통합함으로써, 신경기호 인터페이스가 필요로 하지 않는다.
  • 현재 구현된 구동 시스템은 없지만, 설계에 따르면 GLOM은 보다 새로운 시점에서의 형태 인식 일반화가 가능할 것으로 보이며, 현재 공동 연구 테스트에서 검증되고 있다.
Figure 2: A picture of the embeddings at a particular time in six nearby columns. All of the locations shown belong to the same object and the scene level has not yet settled on a shared vector. The complete embedding vector for each location is shown by dividing the vector into a separate section f
Figure 2: A picture of the embeddings at a particular time in six nearby columns. All of the locations shown belong to the same object and the scene level has not yet settled on a shared vector. The complete embedding vector for each location is shown by dividing the vector into a separate section f

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.