Skip to main content
QUICK REVIEW

[논문 리뷰] Learning by Abstraction: The Neural State Machine

Drew A. Hudson, Christopher D. Manning|arXiv (Cornell University)|2019. 07. 09.
Multimodal Machine Learning Applications참고 문헌 83인용 수 17
한 줄 요약

논문은 시각적 장면을 확률적 장면 그래프로 모델링하고 자연어 질문에 의해 유도되는 주의 기반 상태 전이를 통해 이를 순차적으로 추론하는 가분성 있는 그래프 네트워크인 신경 상태 기계(NSM)를 제안한다. 이는 GQA와 VQA-CP에서 최고 성능을 기록하며, 구조화되고 추상적인 의미 공간에서 작동함으로써 새로운 개념과 언어적 구조로의 강력한 일반화 능력을 입증한다. 이는 모듈성과 해석 가능성 향상에도 기여한다.

ABSTRACT

We introduce the Neural State Machine, seeking to bridge the gap between the neural and symbolic views of AI and integrate their complementary strengths for the task of visual reasoning. Given an image, we first predict a probabilistic graph that represents its underlying semantics and serves as a structured world model. Then, we perform sequential reasoning over the graph, iteratively traversing its nodes to answer a given question or draw a new inference. In contrast to most neural architectures that are designed to closely interact with the raw sensory data, our model operates instead in an abstract latent space, by transforming both the visual and linguistic modalities into semantic concept-based representations, thereby achieving enhanced transparency and modularity. We evaluate our model on VQA-CP and GQA, two recent VQA datasets that involve compositionality, multi-step inference and diverse reasoning skills, achieving state-of-the-art results in both cases. We provide further experiments that illustrate the model's strong generalization capacity across multiple dimensions, including novel compositions of concepts, changes in the answer distribution, and unseen linguistic structures, demonstrating the qualities and efficacy of our approach.

연구 동기 및 목표

  • 시각적 추론에서 신경망과 기호적 AI의 보완적 강점을 통합함으로써 신경망과 기호적 AI 간 격차를 메우기 위해.
  • 딥 러닝 모델의 체계적 일반화, 해석 가능성, 모듈성에 대한 한계를 해결하기 위해.
  • 시각적 장면에 대한 강력한 추론을 가능하게 하기 위해, 복합성과 순차적 추론을 지원하는 구조화되고 추상적인 표현을 통해 수행되는 구조화된 추상적 의미 공간을 제공하기 위해.
  • 시각질문해결에서 새로운 개념, 볼 수 없는 언어적 구조, 이동된 답변 분포에 대한 일반화를 평가하기 위해.

제안 방법

  • 모델은 이미지에서 객체의 속성과 간선이 공간적 및 의미적 관계를 나타내는 확률적 장면 그래프를 먼저 구성한다.
  • 그러한 장면 그래프를 상태 기계로 간주하며, 노드를 상태로, 간선을 전이로 간주하여 그래프를 순차적으로 추론할 수 있도록 한다.
  • 자연어 질문은 소프트 지시로 임bed되어, 반복적인 주의 기반의 그래프 노드 탐색을 통해 답변을 계산한다.
  • 시각적 및 언어적 모odalities를 동일한 추상적 공간에 정렬하기 위해, 개념(객체, 속성, 관계)의 공통된 의미 어휘를 사용한다.
  • 메시지 전달을 통해 가분성 있는 방식으로 추론을 수행하며, 주의 메커니즘이 각 단계에서 관련된 노드와 간선을 선택한다.
  • 아키텍처는 구조와 내용 표현을 분리 유지하면서도 엔드 투 엔드로 훈련되어 답변을 예측하도록 구성된다.

실험 결과

연구 질문

  • RQ1신경 모델이 훈련 중에 볼 수 없었던 시각적 개념의 새로운 조합에 대해 강력한 일반화를 달성할 수 있는가?
  • RQ2훈련 데이터 분포가 이동된 경우에도, 볼 수 없는 언어적 구조를 가진 질문에 대해 모델이 일반화할 수 있는가?
  • RQ3원시 감각 입력을 직접 처리하는 것과 비교해, 추상적이고 구조화된 잠재 공간에서 작동함으로써 모델의 해석 가능성과 모듈성이 향상되는가?
  • RQ4장면 그래프 기반의 자동기계 유사 계산이, 복합 시각적 추론 작업에서 엔드 투 엔드 신경망을 능가할 수 있는가?

주요 결과

  • 신경 상태 기계(NSM)는 GQA의 콘텐츠 일반화 분할에서 최고 성능인 40.24%의 정확도를 기록했으며, 구조 일반화 분할에서는 55.72%를 달성하여 이전 방법들을 크게 앞서 갔다.
  • VQA-CPv2에서 NSM은 45.80%의 정확도를 기록하여, BAN(39.31%)과 ReGAT(40.42%)를 포함한 모든 이전 단일 모델 접근 방식을 뛰어넘었다.
  • 훈련 질문에서 볼 수 없었던 새로운 객체 카테고리(예: 음식, 동물)에 대해 강력한 제로샷 일반화를 보이며, 콘텐츠 분할에서 40.24%의 정확도를 달성했다.
  • 새로운 언어적 구조에 대해 효과적으로 일반화되어, 구조 일반화 분할에서 55.72%의 정확도를 기록하여 문법적 및 의미적 변형에 대한 강건성을 보였다.
  • 답변 분포가 이동된 경우에도 모델의 성능이 높게 유지되어, 테스트 데이터에서 분포 이동에 대한 저항성을 보였다.
  • 제거 실험 결과, 구조화되고 추상적인 표현과 순차적 추론 메커니즘이 모델의 일반화 능력에 핵심적인 역할을 한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.