[논문 리뷰] Learning to Ask Unanswerable Questions for Machine Reading Comprehension
이 논문은 질문에 대한 답변이 가능한 질문을 편집함으로써 해당 단락을 조건으로 하여 관련성이 있는 답변 불가 질문을 생성하는 페어-투-시퀀스 모델을 제안한다. 이는 기계적 읽기 이해를 위한 효과적인 데이터 증강을 가능하게 한다. BERT-base 및 BERT-large 모델을 사용할 때 각각 F1 점수를 1.9점과 1.7점 향상시켜 상당한 성능 향상을 이룬다. 이는 어휘적으로 유사하고 맥락에 기반한 답변 불가 질문으로부터 분류 기반의 훈련 신호를 활용한 결과이다.
Machine reading comprehension with unanswerable questions is a challenging task. In this work, we propose a data augmentation technique by automatically generating relevant unanswerable questions according to an answerable question paired with its corresponding paragraph that contains the answer. We introduce a pair-to-sequence model for unanswerable question generation, which effectively captures the interactions between the question and the paragraph. We also present a way to construct training data for our question generation models by leveraging the existing reading comprehension dataset. Experimental results show that the pair-to-sequence model performs consistently better compared with the sequence-to-sequence baseline. We further use the automatically generated unanswerable questions as a means of data augmentation on the SQuAD 2.0 dataset, yielding 1.9 absolute F1 improvement with BERT-base model and 1.7 absolute F1 improvement with BERT-large model.
연구 동기 및 목표
- 추출 작업에서 뛰어난 성능을 보이지만 여전히 핵심 과제로 남아 있는 답변 불가 질문을 탐지할 수 있는 기계적 읽기 이해 모델의 능력을 향상시키기 위해.
- 단락에 대해 어휘적·맥락적으로 관련성이 있는 답변 불가 질문을 생성하여 단순하거나 무관한 예제를 피하기 위해.
- 자동으로 생성된 답변 불가 질문을 활용한 데이터 증강 전략을 개발하여 독해 이해 모델의 일반화 및 내구성을 향상시키기 위해.
- 공통된 답변 영역를 편의상 피벗으로 삼아 답변 가능 질문과 답변 불가 질문을 정렬하는 훈련 데이터 구성 방법을 설계하기 위해.
- 생성된 답변 불가 질문이 SQuAD 2.0에서 모델 성능 향상에 효과적인 부정 예제로 기능할 수 있는지 평가하기 위해.
제안 방법
- 질문과 단락을 동시에 인코딩할 수 있도록 설계된 페어-투-시퀀스 모델을 도입하여 주목적 기반 상호작용과 맥락 인식 표현 학습을 가능하게 한다.
- 생성 과정에서 단락의 단어를 포함시키기 위해 복사 메커니즘을 사용하여 사실적 일관성과 관련성을 향상시킨다.
- 공통된 답변 영역를 통해 답변 가능 질문과 답변 불가 질문을 정렬함으로써 피벗 기반의 쌍을 생성하는 방식으로 훈련 데이터를 구성한다.
- 단락을 조건으로 하여 단어 교체, 否정, 엔티티 교체 등의 연산을 통해 답변 가능 질문을 편집하여 답변 불가 질문을 생성한다.
- 생성된 답변 불가 질문을 원래의 SQuAD 2.0 답변 가능 예제와 조합하여 데이터 증강을 수행한 후, BERT 기반 모델에서 미세조정을 실시한다.
- 기존의 대규모 MRC 데이터셋을 활용하여 훈련을 위한 대규모 맥락 기반 답변 불가 질문 세트를 생성한다.
실험 결과
연구 질문
- RQ1신경망 모델이 맥락적으로 관련성 있고 독해 이해 모델에 대해 분류적으로 효과적인 답변 불가 질문을 생성할 수 있는가?
- RQ2단락 조건을 고려하여 답변 가능 질문을 편집함으로써 답변 불가 질문을 생성하는 것이 모델의 일반화 능력을 향상시키는가?
- RQ3자동으로 생성된 답변 불가 질문이 강력한 BERT 기반 모델을 포함한 SQuAD 2.0에서 성능 향상에 어느 정도 기여할 수 있는가?
- RQ4생성된 답변 불가 질문의 품질이 TF-IDF 검색이나 규칙 기반 방법과 같은 히وري스틱 기반 베이스라인과 비교해 볼 때 어떻게 다른가?
- RQ5생성된 답변 불가 질문의 수를 늘리면 모델 성능이 더 향상되는가? 그리고 성능 향상의 감소 경향이 나타나는 지점이 존재하는가?
주요 결과
- 자동 평가 및 인간 평가 모두에서 페어-투-시퀀스 모델이 순차-투-순서 기반 베이스라인을 능가하여 더 관련성 있고 다양한 답변 불가 질문을 생성한다.
- BERT-base 모델을 사용할 경우 생성된 답변 불가 질문으로 인해 SQuAD 2.0에서 F1 점수를 1.9점 절대적으로 향상시켰으며, BERT-large 모델을 사용할 경우 1.7점 향상되었다.
- 생성된 답변 불가 질문을 활용한 데이터 증강은 전용 아키텍처와 BERT 미세조정 모두에서 성능 향상에 기여한다.
- 증강 데이터 크기를 늘림(최대 3배)함으로써 성능 향상이 더욱 두드러지며, 특히 BERT-base에서 데이터 다양성의 이점을 보여주고 있어 확장 가능성을 입증한다.
- 규칙 기반 및 TF-IDF 기반의 답변 불가 질문 생성 베이스라인은 최소한의 성능 향상을 제공하여 제안된 페어-투-시퀀스 접근 방식의 우수성을 입증한다.
- 이 방법은 데이터 불균형 문제를 효과적으로 완화하고 강력한 부정 예제를 제공하여, 답이 없을 경우 모델이 회피하는 능력을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.