Skip to main content
QUICK REVIEW

[논문 리뷰] Compositional Questions Do Not Necessitate Multi-hop Reasoning

Sewon Min, Eric Wallace|arXiv (Cornell University)|2019. 06. 07.
Topic Modeling참고 문헌 17인용 수 17
한 줄 요약

이 논문은 복합 질문이 본질적으로 다단계 추론을 필요로 한다는 가정을 도전하며, 단일 단계 추론 기반 BERT 모델이 HotpotQA에서 67 F1을 달성함으로써 최신 다단계 모델과 유사한 성능을 내는 것으로 보여준다. 저자들은 많은 질문이 강력한 실체 유형 신호와 중복된 사실 덕분에 한 단계로도 해결 가능하다는 점을 밝히며, 한 개의 정답 문단만 제공될 경우 인간 평가자들도 80퍼센트 이상의 질문을 해결할 수 있음을 보여, 현재 데이터셋이 다단계 추론의 필요성을 과도하게 평가하고 있음을 시사한다.

ABSTRACT

Multi-hop reading comprehension (RC) questions are challenging because they require reading and reasoning over multiple paragraphs. We argue that it can be difficult to construct large multi-hop RC datasets. For example, even highly compositional questions can be answered with a single hop if they target specific entity types, or the facts needed to answer them are redundant. Our analysis is centered on HotpotQA, where we show that single-hop reasoning can solve much more of the dataset than previously thought. We introduce a single-hop BERT-based RC model that achieves 67 F1---comparable to state-of-the-art multi-hop models. We also design an evaluation setting where humans are not shown all of the necessary paragraphs for the intended multi-hop reasoning but can still answer over 80% of questions. Together with detailed error analysis, these results suggest there should be an increasing focus on the role of evidence in multi-hop reasoning and possibly even a shift towards information retrieval style evaluations with large and diverse evidence collections.

연구 동기 및 목표

  • 다단계 독해 데이터셋에서 복합 질문이 진정으로 다수의 문단을 걸쳐 추론이 필요하다는지 조사하기.
  • 기존의 다단계 데이터셋인 HotpotQA와 같은 데이터셋에서 단일 단계 추론이 어느 정도 가능할지 평가하기.
  • 현재의 오락물 선택 방법이 다단계 추론을 효과적으로 강제하는지 또는 단일 단계 해결책을 허용하는지 평가하기.
  • 다단계 추론을 더 잘 강제하는 대안적 평가 범주를 탐색하기, 예를 들어 적대적 오락물 선택이나 오픈 도메인 검색과 같은 방법.
  • 현재 다단계 데이터셋의 설계 결함을 특정하여, 모델과 인간이 요구되는 추론 단계를 우회할 수 있도록 하는 원인을 규명하기.

제안 방법

  • 각 문단을 독립적으로 읽고 점수를 매기는 단일 단계 BERT 기반 QA 모델을 훈련한다. 가장 높은 답변 신뢰도를 가진 문단을 선택한다.
  • 표준 HotpotQA 개발 세트를 사용하여 표준 오락물과 함께 모델을 평가하여 67.08 F1을 달성한다.
  • 질문과의 TF-IDF 유사도를 사용하여 적대적 오락물을 선택한 후, 모델의 예측 답변 신뢰도를 기반으로 오해의 소지가 있는 문단를 걸러낸다.
  • 인간 평가를 실시하여 평가자들에게 질문당 두 개의 정답 문단 중 하나만 제공함으로써 증거가 불완전한 상황을 시뮬레이션한다.
  • 적대적 오락물을 기반으로 모델을 미세조정하여 새로운 오락물 분포에 대한 강건성과 일반화 능력을 테스트한다.
  • 오락물에 실체 유형을 기반으로 걸러내는 메커니즘을 적용하여 정답 문단의 실체 유형과 일치하는 오락물의 편향을 줄인다.

실험 결과

연구 질문

  • RQ1HotpotQA의 복합 질문이 다단계 추론을 요구하도록 설계되어 있음에도 불구하고, 단일 단계 모델이 어느 정도 해결할 수 있는가?
  • RQ2HotpotQA의 많은 질문들이 명시적으로 복합적이지만, 왜 여전히 단일 단계 추론으로 해결 가능한가?
  • RQ3적대적 오락물 선택이 다단계 데이터셋에서 단일 단계 모델의 성능을 효과적으로 저하시키는가?
  • RQ4더 현실적이고 다양한, 또는 적대적인 오락물 세트에 직면했을 때 단일 단계 모델의 성능은 어떻게 저하되는가?
  • RQ5실체 유형과 중복된 사실은 다단계 QA 데이터셋에서 단일 단계 해결책을 가능하게 하는 데 어떤 역할을 하는가?

주요 결과

  • 단일 단계 BERT 기반 모델이 표준 HotpotQA 개발 세트에서 67.08 F1을 기록하며, 최신 다단계 모델과 동등한 성능을 보였다.
  • 정답 문단 두 개 중 하나만 제공될 경우 인간 평가자들이 80퍼센트 이상의 HotpotQA 질문을 정확히 해결할 수 있어, 다단계 추론이 항상 필요하지 않음을 시사한다.
  • HotpotQA의 브리지 유형 질문 중 35퍼센트는 강력한 실체 유형 신호와 증거 내의 중복된 사실 덕분에 단일 단계로 해결 가능하다.
  • 적대적 오락물 선택은 단일 단계 모델의 성능을 67.08 F1에서 46.84 F1으로 낮추지만, 이러한 오락물 기반으로 재훈련하면 성능이 60.10 F1로 회복되며, 이는 모델이 새로운 오락물 분포에 적응할 수 있음을 보여준다.
  • 오픈 도메인 환경에서 500개의 TF-IDF 검색 문단을 사용할 경우 단일 단계 모델은 오직 39.12 F1을 기록하며, 이는 표준 검색 방법이 정답 문단을 찾지 못함을 시사한다. 그러나 두 개의 정답 문단을 추가하면 성능이 크게 향상되어 53.12 F1로 상승한다.
  • 실체 유형 기반으로 오락물을 걸러내면 원래 오락물에서 모델 성능이 40.73 F1로 떨어지지만, 적대적 오락물에 실체 유형 필터링을 적용한 후 재훈련하면 성능이 58.42 F1로 회복되며, 이는 실체 유형 편향이 단일 단계 해결책을 가능하게 하는 핵심 요소임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.