Skip to main content
QUICK REVIEW

[論文レビュー] English Intermediate-Task Training Improves Zero-Shot Cross-Lingual Transfer Too

Jason Phang, Iacer Calixto|arXiv (Cornell University)|May 26, 2020
Topic Modeling被引用数 10
ひとこと要約

この論文は、英語の言語理解タスクにおける中間タスク学習が、XTREMEベンチマークにおけるゼロショット多言語転送性能を顕著に向上させることを示している。XLM-RをMNLI、SQuAD、HellaSwagといった高リソースな英語タスクで事前微調整した後、最終タスクの微調整を行うことで、XLM-R Largeよりも平均5.4ポイントの向上を達成し、2020年6月時点で新たなSOTAを樹立した。

ABSTRACT

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuning again on the target task---often improves model performance substantially on language understanding tasks in monolingual English settings. We investigate whether English intermediate-task training is still helpful on non-English target tasks. Using nine intermediate language-understanding tasks, we evaluate intermediate-task transfer in a zero-shot cross-lingual setting on the XTREME benchmark. We see large improvements from intermediate training on the BUCC and Tatoeba sentence retrieval tasks and moderate improvements on question-answering target tasks. MNLI, SQuAD and HellaSwag achieve the best overall results as intermediate tasks, while multi-task intermediate offers small additional improvements. Using our best intermediate-task models for each target task, we obtain a 5.4 point improvement over XLM-R Large on the XTREME benchmark, setting the state of the art as of June 2020. We also investigate continuing multilingual MLM during intermediate-task training and using machine-translated intermediate-task data, but neither consistently outperforms simply performing English intermediate-task training.

研究の動機と目的

  • 英語データにおける中間タスク学習が、多言語モデルにおけるゼロショット多言語転送性能を向上させるかどうかを調査すること。
  • 単一言語の英語環境における中間学習の利点が、多言語的・ゼロショット多言語転送にまで拡張されるかどうかを評価すること。
  • 多言語MLMの継続や機械翻訳された中間データの使用といった代替戦略が、単純な英語中間タスク学習を上回るかを評価すること。
  • XTREMEベンチマークの多様なターゲットタスクにおいて、どの中間タスクが最も大きな向上をもたらすかを特定すること。

提案手法

  • 最終タスクの微調整の前に、事前学習済みの多言語XLM-Rモデルを1つ以上の英語中間タスクで微調整する。
  • XTREMEベンチマークから9つの中間タスク(ANLI+、MNLI、QQP、SQuAD v1.1/v2.0、HellaSwag、CCG、Cosmos QA、CSQA)を用いる。
  • XTREMEベンチマークの9つのターゲットタスクにおいて、40言語でゼロショット多言語性能を評価する。
  • 単一タスク中間学習と、全9タスクで行うマルチタスク中間学習を比較する。
  • 2つの変種を調査する:(1) 中間学習中に多言語MLMを継続する、(2) ドイツ語、ロシア語、スワヒリ語の機械翻訳済み中間データを用いる。
  • 開発セットおよびテストセットの結果を報告し、言語およびタスク全体での平均的な性能向上に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1英語タスクにおける中間タスク学習が、多言語ベンチマークにおけるゼロショット多言語転送性能を向上させるか?
  • RQ2どの具体的な英語中間タスクが多言語転送性能の向上で最大の利益をもたらすか?
  • RQ3中間学習中に多言語MLMを継続することで、標準的な英語専用中間学習と比較して性能が向上するか?
  • RQ4他の言語の機械翻訳済み中間データを用いることで、英語データでの学習のみと比較して多言語転送性能が向上するか?
  • RQ5マルチタスク中間学習は、単一タスク中間学習と比較して、ゼロショット一般化性能においてどのように異なるか?

主な発見

  • MNLI、SQuAD v2.0、HellaSwagでの中間学習が、開発セットで最大の向上をもたらし、それぞれ7.5、8.2、7.0ポイントの向上を達成した。
  • 全9タスクでマルチタスク中間学習を実施した場合、開発セットで最高の8.7ポイントの向上を達成した。
  • 本手法は、XTREMEベンチマーク全体でXLM-R Largeよりも平均5.4ポイントの向上を達成し、2020年6月時点で新たなSOTAを樹立した。
  • 英語の中間タスク学習が、中間学習中に多言語MLMを継続する方法や、機械翻訳済み中間データを用いる方法を上回った。
  • BUCCおよびTatoeba(文の検索)では顕著な向上が観察され、一部のケースで30ポイント以上の向上が見られた。
  • TyDiQAでは複数の中間タスクによる学習で一貫した向上が見られたが、XNLIでは中間学習による利益は得られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。