Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Spanish Translation of the SQuAD Dataset for Multilingual Question Answering

Casimiro Pio Carrino, Marta R. Costa‐jussà|arXiv (Cornell University)|2019. 12. 11.
Topic Modeling참고 문헌 3인용 수 42
한 줄 요약

이 논문은 SQuAD v1.1을 스페인어(SQuAD-es)로 번역하는 자동번역-정렬-검색 파이프라인 TAR를 도입하고, 스페인어 QA를 Multilingual-BERT로 학습시키며, 스페인어 MLQA 및 XQuAD 벤치마크에서 SOTA 성능을 달성합니다.

ABSTRACT

Recently, multilingual question answering became a crucial research topic, and it is receiving increased interest in the NLP community. However, the unavailability of large-scale datasets makes it challenging to train multilingual QA systems with performance comparable to the English ones. In this work, we develop the Translate Align Retrieve (TAR) method to automatically translate the Stanford Question Answering Dataset (SQuAD) v1.1 to Spanish. We then used this dataset to train Spanish QA systems by fine-tuning a Multilingual-BERT model. Finally, we evaluated our QA models with the recently proposed MLQA and XQuAD benchmarks for cross-lingual Extractive QA. Experimental results show that our models outperform the previous Multilingual-BERT baselines achieving the new state-of-the-art value of 68.1 F1 points on the Spanish MLQA corpus and 77.6 F1 and 61.8 Exact Match points on the Spanish XQuAD corpus. The resulting, synthetically generated SQuAD-es v1.1 corpora, with almost 100% of data contained in the original English version, to the best of our knowledge, is the first large-scale QA training resource for Spanish.

연구 동기 및 목표

  • 영어 SQuAD v1.1로부터 대규모 스페인어 QA 데이터가 부족한 문제를 해결하기 위해 합성 스페인어 QA 데이터 세트를 생성한다.
  • NMT, 비지도 정렬, 답변 검색을 결합한 모듈형 TAR 파이프라인을 제안하여 스페인어 QA 트리플을 생성한다.
  • SQuAD-es v1.1로 학습된 스페인어 QA 모델을 MLQA 및 XQuAD와 같은 교차 언어 QA 벤치마크에서 평가한다.
  • 다국어 QA를 위한 합성 데이터의 품질과 양의 trade-off가 효과적임을 입증한다.

제안 방법

  • 대규모 다국어 병렬 코퍼스와 공유 어휘를 사용하여 영어→스페인어 NMT 모델을 훈련한다.
  • 소스 맥락과 번역된 맥락을 정렬하기 위한 비지도 맥락 수준 정렬 모델(eflomal/efmaral)을 개발한다.
  • (c_src, q_src, a_src)를 (c_tgt, q_tgt, a_tgt)로 번역하고 정렬을 사용해 대응하는 정답 번역을 검색한다.
  • 정답 구간 매핑과 재배치를 통해 원문 추출형 QA 제약을 처리하고 c_tran에서 유효한 a_tran을 위치시키도록 한다.
  • SQuAD v1.1로부터 두 개의 스페인어 데이터셋을 생성한다: SQuAD-es v1.1(전부 번역)과 SQuAD-es-small(정렬 없이), 정제 휴리스틱과 함께.
  • SQuAD-es v1.1에서 Multilingual-BERT를 미세조정하고 MLQA 및 XQuAD에서 평가한다.

실험 결과

연구 질문

  • RQ1자동으로 번역된 QA 데이터(SQuAD-es)가 스페인어 QA 모델의 최첨단 성능 도달을 가능하게 하는가?
  • RQ2TAR이 생성한 데이터가 다국어 QA 학습에서 정렬 없이 생성된 데이터와 비교해 어떤 차이가 있는가?
  • RQ3번역 품질과 정렬 정확도가 교차 언어 벤치마크에서의 QA 평가에 어떤 영향을 주는가?

주요 결과

  • TAR로 생성된 SQuAD-es v1.1로 학습된 모델이 스페인어 MLQA 및 XQuAD 벤치마크에서 최첨단 F1/EM을 달성한다.
  • MLQA(스페인어)에서 TAR-train + mBERT는 68.1 F1 및 48.3 EM을 달성하며 베이스라인을 능가하고 2019년 SOTA에 근접하다.
  • XQuAD(스페인어)에서 TAR-train + mBERT는 77.6 F1 및 61.8 EM을 달성하여 기존 mBERT 베이스라인을 능가하고 최상의 교차 언어 모델에 근접하다.
  • 정렬 기반 검색을 사용하면 번역된 예시의 총량이 증가하지만 오차율이 높아지고, 정렬을 제거하면 규모는 줄어들지만 일부 설정에서 정밀도가 향상된다.
  • 번역-훈련 baselines과 비교할 때 TAR-train + mBERT는 F1에서 11.6–14.2포인트, EM에서 9.8–10.9포인트의 상당한 향상을 보인다.
  • SQuAD-es v1.1 데이터셋은 대규모 스페인어 QA 자원을 제공하고 강건한 스페인어 QA 성능을 가능하게 하며 TAR 접근법을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.