Skip to main content
QUICK REVIEW

[논문 리뷰] Using Natural Language Relations between Answer Choices for Machine Comprehension

Rajkumar Pujari, Dan Goldwasser|arXiv (Cornell University)|2020. 12. 31.
Topic Modeling참고 문헌 25인용 수 4
한 줄 요약

이 논문은 답변 선택지 간 자연어 추론(NLI) 관계—예를 들어 함의와 모순—를 활용하여 기계 이해 성능을 햖थ하는 방법을 제안한다. 독립형 QA 시스템, NLI 모델, ILP 기반 추론 프레임워크를 사용하여 답변 선택지를 종합적으로 재평가함으로써, MultiRC 및 SemEval-2018 Task-11에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 자기학습 데이터를 사용해 MultiRC에서 21.62%의 EM0 점수를 기록하였다.

ABSTRACT

When evaluating an answer choice for Reading Comprehension task, other answer choices available for the question and the answers of related questions about the same paragraph often provide valuable information. In this paper, we propose a method to leverage the natural language relations between the answer choices, such as entailment and contradiction, to improve the performance of machine comprehension. We use a stand-alone question answering (QA) system to perform QA task and a Natural Language Inference (NLI) system to identify the relations between the choice pairs. Then we perform inference using an Integer Linear Programming (ILP)-based relational framework to re-evaluate the decisions made by the standalone QA system in light of the relations identified by the NLI system. We also propose a multitask learning model that learns both the tasks jointly.

연구 동기 및 목표

  • 답변 선택지 간 의사소통 일관성(Pragmatic consistency)을 모델링하여 기계 이해 성능을 향상시키기.
  • 각 선택지를 별개로 평가하는 독립형 QA 시스템의 한계를 해결하여 상호 선택지 간 관계를 고려하지 못하는 문제를 해결하기.
  • 답변 선택지 간 자연어 추론(함의, 모순, 중립) 관계가 추론 및 예측 정확도 향상에 기여할 수 있는지 탐색하기.
  • QA 및 NLI 작업을 통합하는 공동 학습 프레임워크를 개발하여 일반화 성능 향상시키기.
  • 자기학습이 답변 선택지 쌍 간 관계 탐지에 미치는 영향을 조사하기.

제안 방법

  • 독립형 질문-답변(QA) 시스템이 각 답변 선택지에 대해 초기 진리/거짓 레이블과 신뢰도 점수를 할당한다.
  • 별도의 자연어 추론(NLI) 시스템이 각 질문에 대해 모든 순서쌍의 답변 선택지 간 관계(함의, 모순, 중립)를 분류한다.
  • 정수선형계획(ILP) 기반의 관계 기반 추론 프레임워크가 NLI 관계를 활용하여 QA 예측을 재평가함으로써 논리적 일관성을 강제한다.
  • QA 및 NLI 구성 요소를 함께 학습하는 공동 다중작업 학습 모델을 통해 공유 표현을 통해 두 작업 모두의 성능을 향상시킨다.
  • MultiRC 데이터셋의 예측 결과를 활용하여 NLI 모델에 자기학습을 적용함으로써 관계 탐지 성능을 향상시킨다.
  • ILP 최적화 과정의 입력으로 QA 및 NLI 시스템의 신뢰도 점수를 사용한다.

실험 결과

연구 질문

  • RQ1답변 선택지 간 자연어 추론 관계를 모델링하면 기계 이해 성능 향상에 기여하는가?
  • RQ2NLI 관계를 활용한 ILP 기반 추론이 답변 선택지 간 일관성을 강제하는 데 얼마나 효과적인가?
  • RQ3QA 및 NLI 구성 요소를 공동으로 학습시키면 별도 학습보다 성능 향상에 기여하는가?
  • RQ4MultiRC 데이터셋에 대한 자기학습이 답변 선택지 간 관계 탐지 성능 향상에 어느 정도 기여하는가?
  • RQ5엄격한 함의/모순 외의 암묵적 또는 맥락 기반 관계는 기계 이해 성능 향상에 더 기여할 수 있는가?

주요 결과

  • 자기학습된 NLI 모델을 사용할 경우, MultiRC 데이터셋에서 EM0 점수가 독립형 QA의 18.15%에서 21.62%로 향상되었다.
  • 공동 모델은 MultiRC에서 20.36%의 EM0 및 57.08%의 EM1 성능을 기록하여 독립형 QA 및 기타 기준 모델을 초월하였다.
  • SemEval-2018 Task-11 데이터셋에서 공동 모델은 개발 세트에서 85.4%의 정확도, 테스트 세트에서 82.1%의 정확도를 기록하여 독립형 TriAN-single 모델을 능가하였다.
  • McNemar의 카이제곱 검정을 통해 성능 향상이 통계적으로 유의미하다는 것이 확인되었다.
  • NLI 모델의 성능은 높은 어휘 일치도와 否정어(word)로 인해 제한되었으며, 특히 함의 탐지에 영향을 미쳤다.
  • MultiRC 데이터셋에 대한 자기학습 결과, 답변 선택지 간 비함의/비모순 관계가 존재함을 확인하여 더 넓은 의미적 관계 모델링의 여지가 있음을 시사하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.