Skip to main content
QUICK REVIEW

[논문 리뷰] Transforming Question Answering Datasets Into Natural Language Inference Datasets

Dorottya Demszky, Kelvin Guu|arXiv (Cornell University)|2018. 09. 09.
Topic Modeling참고 문헌 32인용 수 122
한 줄 요약

본 연구는 QA 데이터를 QA2D 변환을 통해 대규모 NLI 데이터셋으로 자동 변환하고, 500k개가 넘는 예시를 가진 QA-NLI를 만들며, QA 도메인에 걸쳐 일반화하는 신경망 QA2D 모델을 학습한다.

ABSTRACT

Existing datasets for natural language inference (NLI) have propelled research on language understanding. We propose a new method for automatically deriving NLI datasets from the growing abundance of large-scale question answering datasets. Our approach hinges on learning a sentence transformation model which converts question-answer pairs into their declarative forms. Despite being primarily trained on a single QA dataset, we show that it can be successfully applied to a variety of other QA resources. Using this system, we automatically derive a new freely available dataset of over 500k NLI examples (QA-NLI), and show that it exhibits a wide range of inference phenomena rarely seen in previous NLI datasets.

연구 동기 및 목표

  • 풍부한 QA 데이터셋을 활용하여 NLI를 다양화하는 동기를 제시한다.
  • QA 데이터로부터 포함/비포함(entailed/non-entailed) NLI 쌍을 생성하는 완전 자동화된 QA2D 변환을 제안한다.
  • QA에서 파생된 NLI가 기존 데이터셋을 넘어 폭넓은 추론 현상을 포괄함을 입증한다.
  • 규칙 기반, 크라우드소싱, 신경망 QA2D 구성요소를 결합한 확장 가능한 파이프라인을 제공하여 고품질 서술문을 생성한다.

제안 방법

  • QA2D 정의: QA 쌍(P, Q, A)을 질문에 답하도록 A를 의역하여 서술문 D로 변환한다.
  • A가 올바를 때 (P, D)로 포함된 NLI 쌍을 구성하고, A가 잘못되었거나 Q에 답이 없을 때 비포함(non-entailments)을 구성한다.
  • 규칙 기반, 크라우드소싱, 신경 시퀀스 모델의 세 가지 QA2D 접근법을 개발한다.
  • 두 가지 설정(처음부터 새로 작성하거나 규칙 기반 출력물을 사후 편집)으로 골드 서술문을 크라우드소싱하여 신경망 QA2D 모델을 학습시킨다.
  • Q와 A를 입력으로 사용해 D를 생성하는 신경 인코더-디코더 모델을 학습하고, 복사 메커니즘과 GloVe 임베딩을 활용한다.

실험 결과

연구 질문

  • RQ1QA에서 파생된 서술문이 다양한 QA 데이터셋에서 유효한 NLI 쌍을 생성할 수 있는가?
  • RQ2SQuAD를 넘어선 QA 데이터셋에 대해 신경망 QA2D 모델은 얼마나 잘 일반화되는가?
  • RQ3자동화된 QA2D로 생성된 NLI 데이터셋이 전통적 NLI 말뭉치보다 더 넓은 범위의 추론 현상을 드러내는가?
  • RQ4QA2D 품질이 NLI 학습 및 주석 아티팩트에 어떤 영향을 미치는가?

주요 결과

  • QA2D는 QA 예제를 포함(NLI)과 비포함(NLI) 쌍으로 변환하여 대규모 NLI 작성을 가능하게 한다.
  • 신경망 QA2D 모델은 다양한 데이터셋에서 BLEU 및 정확일치 지표에 대해 규칙 기반 시스템을 지속적으로 능가한다.
  • 신경 모델은 규칙 기반 접근법보다 더 높은 BLEU 및 정확일치 점수를 달성한다(평균 이득: 약 2.6 BLEU 및 약 6.2% 정확도).
  • 다섯 개의 QA 소스에서 파생된 QA-NLI 데이터셋은 다중 문장 및 메타 수준의 추론을 포함한 다양한 추론 현상을 갖는 500k개가 넘는 NLI 예시를 포함한다.
  • QA-NLI는 SNLI/MultiNLI에서 관찰된 일부 주석 아티팩트를 감소시키고 도메인 간에 다양한 추론 유형을 나타낸다(영화 줄거리, 뉴스, 위키피디아, 시험).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.