[논문 리뷰] Template-Based Question Generation from Retrieved Sentences for Improved Unsupervised Question Answering
이 논문은 검색 기반 및 템플릿 기반 방법을 제안하여, 원래의 문맥이 아닌 검색된 의미적으로 관련된 문장에서 유사한 훈련 데이터를 생성함으로써 추출형 질문 응답을 향상시키는 비지도 질문 생성을 수행한다. 답변을 포함하고 있는 검색된 문장에 템플릿을 적용함으로써, SQuAD에서 F1 점수 64.04, 명명된 엔티티 질문에서 77.55를 기록하여 이전의 비지도 모델보다 상대적으로 14% 향상된 최신 기술 수준(SOTA) 성능을 달성한다.
Question Answering (QA) is in increasing demand as the amount of information available online and the desire for quick access to this content grows. A common approach to QA has been to fine-tune a pretrained language model on a task-specific labeled dataset. This paradigm, however, relies on scarce, and costly to obtain, large-scale human-labeled data. We propose an unsupervised approach to training QA models with generated pseudo-training data. We show that generating questions for QA training by applying a simple template on a related, retrieved sentence rather than the original context sentence improves downstream QA performance by allowing the model to learn more complex context-question relationships. Training a QA model on this data gives a relative improvement over a previous unsupervised model in F1 score on the SQuAD dataset by about 14%, and 20% when the answer is a named entity, achieving state-of-the-art performance on SQuAD for unsupervised QA.
연구 동기 및 목표
- 감독 학습 질문 응답에서의 레이블링 데이터의 고비용과 부족 문제를 해결하기 위해 유사한 훈련 데이터를 활용한 비지도 훈련을 가능하게 한다.
- 간단한 클로즈 스타일 템플릿을 넘어서 유사한 질문의 품질을 향상시키기 위한 방법을 개선한다.
- 의미적으로 관련된 문장을 검색하고 템플릿을 적용하는 것이 최종 QA 성능에 영향을 주는지 조사한다.
- 엔티티 매칭, 템플릿 구조, 데이터 크기의 영향이 모델 성능에 미치는 영향을 평가한다.
- 재현 가능성과 비지도 QA 분야의 향후 연구를 지원하기 위해 유사한 훈련 데이터와 코드를 공개한다.
제안 방법
- 원본 문맥 문단과 최소한 하나의 추가 명명된 엔티티를 공유하고 답변 엔티티를 포함하는 위키피디아 코퍼스에서 문장을 검색한다.
- 사전 훈련된 NER 시스템(spaCy)을 사용하여 질문 문맥과 검색된 문장 양쪽에서 명명된 엔티티를 추출한다.
- 답변을 삽입하고 엔티티 유형에 따라 wh-어순(wh-word)을 사용하여 검색된 문장을 질문으로 변환하는 템플릿 기반 질문 생성 모듈을 적용한다.
- 다양한 어순(예: Wh + B + A + ?)과 wh-어순 유형(예: what, who)을 사용하여 템플릿의 구조적 영향을 탐색한다.
- F1 유사도 임계값(≤95%)을 사용하여 유사하거나 표절에 가까운 문장을 걸러내며, 최소한 하나의 추가 공유 엔티티를 요구한다.
- 유사한 질문-답변 쌍에 대해 BERT-large 모델을 미세조정하고 SQuAD v1.1 개발 및 테스트 세트에서 평가한다.
실험 결과
연구 질문
- RQ1원본 문맥이 아닌 검색된 관련 문장에서 질문을 생성하는 것이 최종 QA 성능을 향상시키는가?
- RQ2wh-어순과 템플릿 구조의 선택이 생성된 질문의 품질과 모델 성능에 어떤 영향을 미치는가?
- RQ3검색된 문장과 문맥 간에 추가 엔티티 매칭을 요구할 경우 모델 일반화에 어떤 영향을 미치는가?
- RQ4강력한 성능을 달성하기 위해 얼마나 많은 유사한 데이터가 필요한가? 성능이 포화 상태에 도달하거나 감소하는가?
- RQ5이 방법을 사용한 비지도 질문 생성이 낮은 데이터 환경에서 감독 학습 기반 모델과 경쟁하거나 능가할 수 있는가?
주요 결과
- 제안된 템플릿 기반 방법은 SQuAD 테스트 F1 점수 64.04를 기록하여 이전 비지도 모델 대비 상대적으로 14% 향상된 성능을 달성한다.
- 명명된 엔티티 질문(SQuAD-NER)에서 이 방법은 F1 점수 77.55를 기록하여 이전 비지도 모델 대비 상대적으로 20% 향상된 성능을 보였다.
- 엔티티 유형에 맞는 wh-어순(예: 사람에 대해 'who')을 사용할 경우 'what'만 사용하는 것보다 성능 향상이 뚜렷하다.
- 검색된 문장과 문맥 간에 최소한 하나의 추가 공유 명명된 엔티티가 있어야 하는 조건을 적용할 경우, 매칭이 없는 경우보다 F1 점수 5점 이상 향상된다.
- 50,000개의 유사한 예제 이후 성능이 포화 상태에 도달하며, 제안된 방법으로 10,000개의 예제를 사용하는 것만으로도 이전 비지도 모델가 400만 개의 예제로 훈련한 성능을 초월한다.
- 비지도 모델이 50,000개의 유사한 예제를 사용할 경우, 레이블링된 예제 3,000개로 미세조정한 완전한 감독 학습 모델의 성능과 동일한 성능을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.