Skip to main content
QUICK REVIEW

[논문 리뷰] Automating Reading Comprehension by Generating Question and Answer Pairs

Vishwajeet Kumar, Kireeti Boorla|arXiv (Cornell University)|2018. 03. 07.
Topic Modeling참고 문헌 17인용 수 12
한 줄 요약

이 논문은 포인터 네트워크를 사용해 핵심 답변 구간을 먼저 식별하고, 풍부한 언어적 특징과 답변 인코딩을 통한 시퀀스 투 시퀀스 모델을 활용해 맥락적으로 관련성이 높은 질문을 생성함으로써 고품질의 질문-답변 쌍을 생성하는 이단계 신경망 프레임워크를 제안한다. 이 방법은 자동 평가 지표와 인간 평가 모두에서 기존 최고 수준의 방법들을 뛰어넘으며, BLEU 점수 최대 4점 향상과 질문 생성의 관련성 12.3% 향상을 달성한다.

ABSTRACT

Neural network-based methods represent the state-of-the-art in question generation from text. Existing work focuses on generating only questions from text without concerning itself with answer generation. Moreover, our analysis shows that handling rare words and generating the most appropriate question given a candidate answer are still challenges facing existing approaches. We present a novel two-stage process to generate question-answer pairs from the text. For the first stage, we present alternatives for encoding the span of the pivotal answer in the sentence using Pointer Networks. In our second stage, we employ sequence to sequence models for question generation, enhanced with rich linguistic features. Finally, global attention and answer encoding are used for generating the question most relevant to the answer. We motivate and linguistically analyze the role of each component in our framework and consider compositions of these. This analysis is supported by extensive experimental evaluations. Using standard evaluation metrics as well as human evaluations, our experimental results validate the significant improvement in the quality of questions generated by our framework over the state-of-the-art. The technique presented here represents another step towards more automated reading comprehension assessment. We also present a live system \footnote{Demo of the system is available at \url{https://www.cse.iitb.ac.in/~vishwajeet/autoqg.html}.} to demonstrate the effectiveness of our approach.

연구 동기 및 목표

  • 기존 질문 생성 시스템이 질문 생성에만 집중하고 답변과의 통합 생성을 고려하지 않는 격차를 보완하기 위해.
  • 구문적 및 의미적 정확성을 향상시키기 위해 답변 인코딩과 풍부한 언어적 특징을 통합하여 생성된 질문의 품질을 향상시키기 위해.
  • 질문 생성을 위한 문장 내 가장 관련성 있는 답변 구간을 식별하는 프레임워크를 개발하여 희귀어 및 답변 관련성 문제를 해결하기 위해.
  • 자동 평가 지표와 인간 평가를 모두 활용해 답변 인코딩과 언어적 특징의 질문 품질에 미치는 영향을 평가하기 위해.

제안 방법

  • 이단계 아키텍처: 첫 번째로, 포인터 네트워크가 입력 문장 내에서 가장 관련성 있는 답변 구간을 식별한다.
  • 두 번째로, 시퀀스 투 시퀀스 모델이 입력 문장, 예측된 답변 구간, 그리고 풍부한 언어적 특징(예: 품사 태그, 의존성 파싱, 명명된 실체)을 조건으로 하여 질문을 생성한다.
  • 전역 어텐션 메커니즘을 통해 디코더에 답변 인코딩을 통합하여 질문과 대상 답변 간의 관련성을 향상시킨다.
  • 입력 문장과 답변 표현 양쪽에 주의를 기울이는 수정된 디코더를 사용하여 답변 인식 질문 생성을 향상시킨다.
  • 품사 태그, 의존 관계, 명명된 실체 인식과 같은 언어적 특징을 사용하여 입력 표현을 풍부하게 하고 일반화 능력을 향상시킨다.
  • 교차 엔트로피 손실을 사용해 엔드 투 엔드로 훈련하고, BLEU, METEOR, ROUGE-L 및 인간 평가를 통해 평가한다.

실험 결과

연구 질문

  • RQ1질문 생성과 함께 답변 구간을 동시에 탐지하는 이단계 신경망 프레임워크가 기존 방법에 비해 질문 품질을 향상시킬 수 있는가?
  • RQ2풍부한 언어적 특징이 생성된 질문의 구문적 및 의미적 정확성에 어떤 영향을 미치는가?
  • RQ3답변 인코딩이 생성된 질문과 대상 답변 간의 관련성에 어느 정도 향상시키는가?
  • RQ4정답을 사용하는 대신 가장 적절한 답변 구간을 예측하는 것이 질문 생성 성능을 향상시키는가?
  • RQ5언어적 특징과 답변 인코딩의 다양한 조합이 질문-답변 쌍의 전체 품질에 어떤 영향을 미치는가?

주요 결과

  • 언어적 특징과 정답 인코딩을 통합한 제안된 모델 QG+F+GAE는 모든 평가 지표에서 최고 성능을 기록하며, 기존 최고 수준의 QG 모델 대비 최대 4 BLEU 포인트 향상시켰다.
  • 언어적 특징만 추가해도 기본 QG 모델 대비 문법 정확도 2% 향상, 의미 정확도 9% 향상, 관련성 12.3% 향상되었다.
  • 답변 인코딩이 질문의 관련성 향상에 크게 기여했으며, 답변 인코딩이 없는 모델는 언어적 특징이 존재하더라도 낮은 품질의 질문을 생성했다.
  • 명시적 실체만을 답변 후보로 사용하는 모델 QG+F+NE는 성능이 열악했으며(모든 답변의 50%만이 명시적 실체), 단순히 명시적 실체에 의존하는 것의 한계를 보여주었다.
  • 인간 평가를 통해 제안된 프레임워크가 기존 시스템보다 더 자연스럽고 관련성 있고 의미적으로 정확한 질문을 생성하는 것으로 확인되었다.
  • 이 프레임워크는 답변 구간 탐지와 질문 생성을 함께 모델링할 경우 더 높은 품질의, 맥락적으로 적절한 질문-답변 쌍을 생성할 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.