Skip to main content
QUICK REVIEW

[논문 리뷰] Latent Compositional Representations Improve Systematic Generalization in Grounded Question Answering

Ben Bogin, Sanjay Subramanian|arXiv (Cornell University)|2020. 07. 01.
Topic Modeling참고 문헌 44인용 수 6
한 줄 요약

이 논문은 기반 질문 이해에서 잠재적 조합 구조를 하향식, CKY 스타일의 구문 분석 과정을 통해 유도하는 신경망 모델인 기반 잠재 트리(Grounded Latent Trees, GLT)를 제안한다. 끝점에서의 지도 학습을 통해 모든 질문 구간에 대해 계층적이고 조합적인 방식으로 표현과 의미를 계산함으로써, GLT는 Closure 데이터셋에서 96.1%의 정확도를 달성하며 강력한 기준 모델보다 24점 높게, 체계적 일반화 능력 향상이著명하다. 이는 분포 외 조합에 대한 체계적 일반화 능력 향상의 중요한 성과를 보여준다.

ABSTRACT

Answering questions that involve multi-step reasoning requires decomposing them and using the answers of intermediate steps to reach the final answer. However, state-of-the-art models in grounded question answering often do not explicitly perform decomposition, leading to difficulties in generalization to out-of-distribution examples. In this work, we propose a model that computes a representation and denotation for all question spans in a bottom-up, compositional manner using a CKY-style parser. Our model induces latent trees, driven by end-to-end (the answer) supervision only. We show that this inductive bias towards tree structures dramatically improves systematic generalization to out-of-distribution examples, compared to strong baselines on an arithmetic expressions benchmark as well as on CLOSURE, a dataset that focuses on systematic generalization for grounded question answering. On this challenging dataset, our model reaches an accuracy of 96.1%, significantly higher than prior models that almost perfectly solve the task on a random, in-distribution split.

연구 동기 및 목표

  • 기반 질문 이해에서 분포 외(OOD) 조합에 대한 체계적 일반화 실패 문제를 해결하기 위해.
  • 조합적이고 계층적인 계산에 대한 인도적 편향을 도입함으로써, 분포 내 성능을 넘어서 일반화 능력 향상이 가능한지 조사하기 위해.
  • 골드 구조 지도 없이도 잠재적 문법-의미적 구조를 학습할 수 있는 모델을 개발하기 위해.
  • 유도된 조합 구조가 모델 성능 향상과 인간의 해석 가능성 향상에 기여하는지 평가하기 위해.

제안 방법

  • 모델는 질문 내 모든 구간에 대해 하향식으로 표현과 의미(객체 집합)를 반복적으로 계산하는 CKY 스타일의 파서를 사용한다. 이 과정은 개별 단어에서 시작된다.
  • 의미는 하향식으로, 구간의 내용과 하위 구간 출력을 기반으로 객체 집합을 예측하는 학습된 모듈을 사용해 계산된다.
  • 모델는 최종 답변 지도만을 사용해 엔드 투 엔드로 훈련되며, 최적화 과정을 통해 의미 있는 잠재 트리 구조를 발견하도록 유도된다.
  • 디코딩 중 각 노드에서 가장 확률이 높은 분할과 모듈을 선택함으로써 잠재 트리 구조가 유도되며, 이는 조합적 추론을 가능하게 한다.
  • 전반적인 맥락을 피하기 위해 정보 흐름을 하위 구간으로 제한함으로써, 단기적 학습에 의존하는 것을 줄인다.
  • 모델는 합성 산술 표현식과 체계적 일반화를 강조하는 Closure 데이터셋 모두에서 평가된다.

실험 결과

연구 질문

  • RQ1조합적 계산에 대한 인도적 편향을 가진 신경망 모델이 기반 질문 이해에서 분포 외 조합에 대해 더 나은 일반화 성능을 보일 수 있는가?
  • RQ2엔드 투 엔드 훈련을 통해 잠재적 문법적 구조를 유도함으로써 체계적 일반화 기준 평가 성능 향상이 가능한가?
  • RQ3모델이 생성한 중간 단계의 조합적 구조가 인간의 해석 가능성에 어느 정도 기여하는가?
  • RQ4새로운 조합이 요구되는 OOD 분할에서 모델의 성능이 강력한 기준 모델과 비교해 어떻게 되는가?
  • RQ5실제 인간이 제기한 질문(예: CLEVR-Humans)에서도 높은 정확도를 달성하면서도 조합적 인도적 편향을 유지할 수 있는가?

주요 결과

  • Closure 데이터셋에서 GLT 모델는 조합적 OOD 분할에서 96.1%의 정확도를 달성했으며, 강력한 기준 모델보다 24个百分点 높고, 골드 구조를 사용한 모델보다도 19个百分点 높다.
  • 산술 표현식 기준 평가에서 GLT는 OOD 분할에서 98.4%의 정확도를 기록했고, 강력한 Transformer 기준 모델는 단지 2.9%의 정확도로 완전히 실패했다.
  • 예상되는 구성요소의 81.6–83.1%를 정확히 식별했으며, CLEVR에서 의미 F1 점수는 95.9%, Closure에서 94.7%로 높았다.
  • 전방 예측 테스트에서 인간 참가자들은 의미 트리(82.5% 정확도)를 보여준 경우에 질문과 답변만을 본 경우(58.1% 정확도)보다 유의미하게 더 정확하게 모델 행동을 예측했다.
  • 모델의 중간 출력은 매우 해석 가능하다: Closure에서 구성요소의 83.1%가 정확히 예측되었고, 오류는 주로 분할 예측 오류에서 기인하며 의미 오류는 거의 없었다.
  • 모델는 실제 인간이 제기한 질문에도 잘 일반화되어 CLEVR-Humans에서 99.1%의 정확도를 달성했으며, 자연어 변형에 대한 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.