Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Spanish Translation of the SQuAD Dataset for Multilingual Question Answering

Casimiro Pio Carrino, Marta R. Costa‐jussà|arXiv (Cornell University)|Dec 11, 2019
Topic Modeling参考文献 3被引用数 42
ひとこと要約

この論文は TAR を導入します。自動翻訳-整列-検索パイプラインで SQuAD v1.1 をスペイン語(SQuAD-es)に翻訳し、スペイン語 QA を Multilingual-BERT で訓練し、スペイン語の MLQA と XQuAD ベンチマークで最先端の結果を達成します。

ABSTRACT

Recently, multilingual question answering became a crucial research topic, and it is receiving increased interest in the NLP community. However, the unavailability of large-scale datasets makes it challenging to train multilingual QA systems with performance comparable to the English ones. In this work, we develop the Translate Align Retrieve (TAR) method to automatically translate the Stanford Question Answering Dataset (SQuAD) v1.1 to Spanish. We then used this dataset to train Spanish QA systems by fine-tuning a Multilingual-BERT model. Finally, we evaluated our QA models with the recently proposed MLQA and XQuAD benchmarks for cross-lingual Extractive QA. Experimental results show that our models outperform the previous Multilingual-BERT baselines achieving the new state-of-the-art value of 68.1 F1 points on the Spanish MLQA corpus and 77.6 F1 and 61.8 Exact Match points on the Spanish XQuAD corpus. The resulting, synthetically generated SQuAD-es v1.1 corpora, with almost 100% of data contained in the original English version, to the best of our knowledge, is the first large-scale QA training resource for Spanish.

研究の動機と目的

  • 大規模なスペイン語 QA データの不足に対処するため、英語 SQuAD v1.1 から合成スペイン語 QA データセットを生成する。
  • NMT、無監督アラインメント、回答検索を組み合わせたモジュラーな TAR パイプラインを提案し、スペイン語 QA のトリプルを生成する。
  • SQuAD-es v1.1 で訓練したスペイン語 QA モデルを MLQA と XQuAD のクロスリンガル QA ベンチマークで評価する。
  • 合成データの品質と量のトレードオフが多言語 QA に有効であることを示す。

提案手法

  • 大規模な多言語平行コーパスと共有語彙を用いて英語→スペイン語の NMT モデルを訓練する。
  • ソース文と翻訳文のコンテキストを整列させるための教師なしの文脈レベルアラインメントモデル(eflomal/efmaral)を開発する。
  • (c_src, q_src, a_src)を(c_tgt, q_tgt, a_tgt)に翻訳し、アラインメントを用いて対応する回答翻訳を検索する。
  • 抽出型 QA の制約に対処するため、アラインメントを介して回答のスパンをマッピングし、c_tran で有効な a_tran を見つけるよう再順序付けを行う。
  • SQuAD v1.1 から 2 つのスペイン語データセットを作成する: SQuAD-es v1.1(全て翻訳)、SQuAD-es-small(アラインメント不要)で、クリーニングヒューリスティックを適用。
  • SQuAD-es v1.1 で Multilingual-BERT をファインチューニングし、MLQA と XQuAD で評価する。

実験結果

リサーチクエスチョン

  • RQ1自動翻訳された QA データ(SQuAD-es)によりスペイン語 QA モデルは最先端の性能を達成できるか?
  • RQ2TAR 生成データは多言語 QA の学習におけるアラインメント不要の合成データと比較してどうか?
  • RQ3翻訳品質とアラインメント精度はクロスリンガルベンチマークでの QA 評価にどう影響するか?

主な発見

  • TAR 生成 SQuAD-es v1.1 で訓練したモデルは、スペイン語の MLQA および XQuAD ベンチマークで最先端の F1/EM を達成。
  • MLQA(スペイン語)で、TAR-train + mBERT は 68.1 F1 と 48.3 EM を達成し、ベースラインを上回り、2019年の最先端に近い。
  • XQuAD(スペイン語)で、TAR-train + mBERT は 77.6 F1 と 61.8 EM を達成し、従来の mBERT ベースラインを上回り、最良のクロスリンガルモデルに近づく。
  • アラインメントベースの検索を使用すると総翻訳例数が増えるが誤差率が高くなる; アラインメントを削除するとサイズは減るが一部設定で精度が改善。
  • 翻訳-train ベースラインと比較して、TAR-train + mBERT は F1 を 11.6–14.2 ポイント、EM を 9.8–10.9 ポイント大きく改善。
  • SQuAD-es v1.1 は大規模なスペイン語 QA リソースを提供し、スペイン語 QA の堅牢な性能を実現する TAR アプローチを検証する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。