Skip to main content
QUICK REVIEW

[論文レビュー] MultiFiT: Efficient Multi-lingual Language Model Fine-tuning

Julian Martin Eisenschlos, Sebastian Ruder|arXiv (Cornell University)|Sep 10, 2019
Topic Modeling参考文献 18被引用数 7
ひとこと要約

MultiFiTは、1台のGPUで複数言語の単言語言語モデルを微調整するための効率的な手法を提案する。ULMFiTとQRNN、サブワードトークン化を組み合わせたもので、100件のラベル付き例しか使用しなくても、マルチリンガルBERT や LASER といった最先端のクロスリンガルモデルを上回る。ゼロショットおよび教師あり設定の両方で、最小限のデータと計算リソースで微調整された単言語モデルが、高価なクロスリンガルモデルを上回ることを示している。

ABSTRACT

Pretrained language models are promising particularly for low-resource languages as they only require unlabelled data. However, training existing models requires huge amounts of compute, while pretrained cross-lingual models often underperform on low-resource languages. We propose Multi-lingual language model Fine-Tuning (MultiFiT) to enable practitioners to train and fine-tune language models efficiently in their own language. In addition, we propose a zero-shot method using an existing pretrained cross-lingual model. We evaluate our methods on two widely used cross-lingual classification datasets where they outperform models pretrained on orders of magnitude more data and compute. We release all models and code.

研究の動機と目的

  • 低リソース言語においてもゼロショット転送能力を有するものの、性能が劣るクロスリンガルモデルの課題を解決すること。
  • 特に低リソース言語向けに、多言語言語モデルの学習にかかる計算コストを低減すること。
  • 少量のラベル付きデータで微調整された単言語モデルが、はるかに多くのデータで学習されたクロスリンガルモデルを上回ることを実証すること。
  • 単言語とクロスリンガルの事前学習信号の相乗効果が、より強固な性能とゼロショット一般化能力を向上させることを探索すること。

提案手法

  • MultiFiTは、サブワードトークン化とユニバーサル言語モデル微調整(ULMFiT)を組み合わせた準再帰的ニューラルネットワーク(QRNN)アーキテクチャを用い、1台のTesla V100 GPUで単言語言語モデルを効率的に学習する。
  • ラベル付きデータがターゲット言語に存在しない状況でも、事前学習済みのクロスリンガルモデル(例:LASER)が生成する疑似ラベルを用いて、単言語モデルを初期化するゼロショット適応手法を導入する。
  • モデルは1言語あたり1億トークンの単語レベルWikipediaデータで事前学習され、100件のラベル付き例でのみ微調整される。
  • SentencePieceを用いて学習された共有サブワード語彙を採用することで、語形が複雑でリソースが少ない言語の効率的処理が可能になる。
  • ラベルノイズに対する耐性を検証するため、最大75%までラベルをランダムに破損させた実験を行い、事前学習によりノイズのある教師信号に対しても一般化が可能であることを示した。
  • MLDocおよびCLSデータセットにおいて、トークン化戦略(サブワード対ワードベース)とモデルバージョン(事前学習有無)の性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1少量のラベル付きデータで微調整された単言語言語モデルが、膨大な並列または多言語事前学習を必要とするクロスリンガルモデルを上回ることができるか?
  • RQ2単語レベルの事前学習が、低リソース環境におけるラベルノイズに対する耐性を向上させるか?
  • RQ3クロスリンガルモデルから生成された疑似ラベルは、単語レベル微調整におけるゼロショット転送をどの程度効果的に可能にするか?
  • RQ4語形が複雑でリソースが少ない言語において、サブワードトークン化はワードベースのトークン化を上回る効果を示すか?
  • RQ5単語レベルとクロスリンガルの事前学習信号が、多言語転送学習においてどの程度相乗効果をもたらすか?

主な発見

  • 1言語あたり1,000件のラベル付き例での微調整でも、事前学習が行われておらずとも、MultiFiTはマルチリンガルBERT や LASER を上回る性能を示した。
  • 1言語あたり100件のラベル付き例でのみ微調整した場合、MLDocデータセットにおいてドイツ語とフランス語のゼロショット手法をすべて上回り、F1スコアはそれぞれ91.34%および89.45%を達成した。
  • 事前学習済みのMultiFiTモデルは、ラベルノイズが65%まで耐えられるが、ランダム初期化モデルは高ノイズ条件下で理論的下限を上回ることができなかった。
  • サブワードトークン化は、ドイツ語やロシア語を含む多数の言語で、より高い精度とより小さい語彙サイズによる高速な学習を実現し、ワードベースのトークン化を上回った。
  • 100Mトークンの単語レベル事前学習を施したMultiFiTは、はるかに多くのデータと計算リソースを要したマルチリンガルBERT や LASER を上回った。
  • 8言語にわたるMLDocおよびCLSデータセットにおいて、MultiFiTは最先端の結果を達成した。これは、効率的な単語レベル微調整が、高価なクロスリンガル代替手法を凌駃することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。