Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Synthetic Data Generation for Domain Adaptation of Question Answering Systems

Siamak Shakeri, Cícero Nogueira dos Santos|arXiv (Cornell University)|2020. 10. 12.
Topic Modeling참고 문헌 32인용 수 21
한 줄 요약

이 논문은 미세조정된 BART 기반 인코더-디코더 트랜스포머를 사용하여 단일 모델 기반의 엔드 투 엔드 접근 방식을 제안한다. 이 모델은 문장에서 토큰 단위로 질문과 답변을 생성하며, 언어 모델의 가능도를 필터링 점수로 사용하여 NQ, BioASQ, NewsQA 및 DuoRC에서 최신 기술 수준의 도메인 적응 성능을 달성한다. NQ에서는 EM 점수에서 8점 이상 향상되었고, 다른 데이터셋에서는 4점 이상 향상되었다.

ABSTRACT

We propose an end-to-end approach for synthetic QA data generation. Our model comprises a single transformer-based encoder-decoder network that is trained end-to-end to generate both answers and questions. In a nutshell, we feed a passage to the encoder and ask the decoder to generate a question and an answer token-by-token. The likelihood produced in the generation process is used as a filtering score, which avoids the need for a separate filtering model. Our generator is trained by fine-tuning a pretrained LM using maximum likelihood estimation. The experimental results indicate significant improvements in the domain adaptation of QA models outperforming current state-of-the-art methods.

연구 동기 및 목표

  • 오류 전파와 높은 계산 비용으로 인해 문제가 되는 다단계 합성 QA 데이터 생성 파이프라인의 한계를 해결하기 위해.
  • 스팬 검출 및 질문 필터링 모듈을 별도로 두는 것 없이, 답변과 질문 생성을 하나의 엔드 투 엔드 모델에 통합함으로써 필요성을 제거하기 위해.
  • 단일 미세조정된 트랜스포머 모델만을 사용하여 고품질의 합성 QA 쌍을 생성함으로써 QA 시스템의 도메인 적응을 향상시키기 위해.
  • 언어 모델 가능도 점수가 합성 QA 데이터의 전용 필터링 모델을 대체할 수 있는지 평가하기 위해.

제안 방법

  • 최대 가능도 추정을 통해 미세조정된 트랜스포머 기반 인코더-디코더 모델(BART)을 사용하여, 문장에 조건부로 답변과 질문을 동시에 생성한다.
  • 세 가지 변형을 훈련한다: AQGen(답변 생성 후 질문 생성), QAGen(질문 생성 후 답변 생성), QAGen2S(첫 번째 단계에서 질문을 생성하고, 두 번째 단계에서 문맥을 결합한 후 답변 생성).
  • 생성된 시퀀스의 로그 가능도를 필터링 점수로 사용하여 고품질의 QA 쌍을 순위 매기고 선택함으로써 별도의 필터링 모델이 필요 없도록 한다.
  • 목표 도메인의 문장(예: NQ, PubMed)을 대상으로 합성 QA 쌍을 생성하고, 합성 데이터와 소스 도메인(SQuAD) 데이터를 함께 사용하여 최종 독해 모델을 미세조정한다.
  • LM 기반 필터링, 순환 전환 필터링, 필터링 없음의 세 가지 방법을 비교하여 필터링 효과를 평가한다.
  • 데이터셋 크기와 모델 용량에 대한 분석을 통해 작은 모델과 큰 모델 모두에서의 확장성과 내구성을 평가한다.

실험 결과

연구 질문

  • RQ1스팬 검출 또는 별도의 필터링 모듈 없이도 단일 엔드 투 엔드 트랜스포머 모델이 문장에서 질문과 답변을 효과적으로 생성할 수 있는가?
  • RQ2언어 모델 가능도 점수가 최종 F1 점수와 충분히 강한 상관관계를 가지는가? 이를 통해 합성 QA 쌍의 필터링을 신뢰할 수 있는 대체 수단으로 사용할 수 있는가?
  • RQ3다단계 파이프라인에 비해 엔드 투 엔드 합성 데이터 생성 방식이 QA의 도메인 적응에서 성능과 효율성 측면에서 어떻게 비교되는가?
  • RQ4소스 도메인(SQuAD)에서 생성된 합성 데이터가 다양한 목표 도메인(NQ, BioASQ, NewsQA 등)에서 성능 향상에 얼마나 기여하는가?
  • RQ5제안된 방법이 소형 및 대형 사전 학습된 언어 모델(BERT-base, RoBERTa-large 등)이 자원이 부족한 도메인 적응 환경에서 성능 향상에 기여할 수 있는가?

주요 결과

  • QAGen2S는 첫 번째 단계에서 질문을 생성하고, 두 번째 단계에서 문맥을 결합한 후 답변을 생성하는 방식으로 가장 뛰어난 성능을 보였으며, Natural Questions 데이터셋에서 SQuAD 기준보다 EM 점수 8.1점, F1 점수 7.3점 향상되었다.
  • BioASQ 및 NewsQA에서 QAGen2S는 EM 점수를 4점 이상 향상시켜 다양한 도메인에 걸쳐 강력한 일반화 능력을 입증했다.
  • LM 가능도를 필터링 점수로 사용할 경우, 최종 F1 점수와 강한 상관관계를 보였지만, 노이즈가 많고 높은 임계값이 필요로 해서 고품질 샘플을 확보하기 어려웠다.
  • QAGen2S에서 생성된 합성 데이터는 RoBERTa-large 모델에서 SQuAD 개선 데이터셋에서 F1/EM 점수 각각 3.1/2.2점 향상되었고, BERT-base-uncased에서는 각각 1.0/0.5점 향상되었다.
  • 엔드 투 엔드 모델은 다단계 기준 모델과 다른 생성 순서(AQGen, QAGen)보다 성능이 뛰어나며, 두 번째 단계에서 이중 방향 문맥을 활용한 공동 생성의 효과를 입증했다.
  • 합성 데이터셋 크기가 커질수록 성능 향상이 뚜렷했으며, 특히 SQuAD 데이터를 사용하지 않을 경우 더욱 두드러져 자원이 부족한 환경에서 합성 데이터의 가치를 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.