Skip to main content
QUICK REVIEW

[論文レビュー] Are All Languages Created Equal in Multilingual BERT?

Shijie Wu, Mark Dredze|arXiv (Cornell University)|May 18, 2020
Topic Modeling参考文献 29被引用数 16
ひとこと要約

この論文は、104の言語で訓練されたMultilingual BERT (mBERT) が、すべての言語で同等の高品質な表現を学習しているかどうかを調査する。それぞれ99語と54語の言語でNamed Entity Recognition (NER)、Part-of-Speech (POS)タギング、依存性パーサーを用いた実験により、mBERTは低リソース言語において顕著に性能を発揮せず、非BERTベースラインよりも劣り、同じアーキテクチャを持つ単語別BERTでもさらに劣る。低リソース言語と言語的に関連する言語をペアにした場合、性能は向上するがmBERTに到達しない。これは、低リソース言語に対して、多言語事前学習が重要な誘導的バイアスを提供していることを示している。

ABSTRACT

Multilingual BERT (mBERT) trained on 104 languages has shown surprisingly good cross-lingual performance on several NLP tasks, even without explicit cross-lingual signals. However, these evaluations have focused on cross-lingual transfer with high-resource languages, covering only a third of the languages covered by mBERT. We explore how mBERT performs on a much wider set of languages, focusing on the quality of representation for low-resource languages, measured by within-language performance. We consider three tasks: Named Entity Recognition (99 languages), Part-of-speech Tagging, and Dependency Parsing (54 languages each). mBERT does better than or comparable to baselines on high resource languages but does much worse for low resource languages. Furthermore, monolingual BERT models for these languages do even worse. Paired with similar languages, the performance gap between monolingual BERT and mBERT can be narrowed. We find that better models for low resource languages require more efficient pretraining techniques or more data.

研究の動機と目的

  • 104の言語の広範なセット、特に低リソース言語を対象として、mBERTのゼロショット多言語間転移性能を評価すること。これまでの研究が高リソース言語に限定されていたのを越えて。
  • mBERTの低リソース言語における性能を、同じデータで訓練された単語別BERTと比較することで、性能の悪さがモデルアーキテクチャの問題か、データ不足の問題かを隔離すること。
  • 低リソース言語と言語的に関連する言語をペアにすることで表現品質が向上するかを調査すること。これは、単語別学習と大量多言語学習の中間のアプローチとしての意義を検討するため。
  • 低リソース言語における性能格差が、データの不均衡、サブワード分布バイアス、それとも共同多言語事前学習の本質的限界に起因するかを特定すること。

提案手法

  • 標準的な下流評価プロトコルに従い、mBERTをNamed Entity Recognition (NER)、Part-of-Speech (POS)タギング、依存性パーサーのそれぞれ99語、54語、54語の言語で微調整した。
  • mBERTで使用された同じ低リソース言語コーパスを用いて、同一のハイパーパrameterを用いて単語別BERTモデルを訓練し、多言語事前学習の影響を隔離した。
  • 低リソース言語とそれと言語的に関連する高リソース言語(例:ラトビア語–リトアニア語、アフリカン語–オランダ語)のペアを共同事前学習することで、二言語BERTモデルを構築した。
  • バッチサイズとシーケンス長を固定し、唯一変更したのは語彙サイズとシーケンス長として、効率的トレードオフを評価する制御された事前学習設定を採用した。
  • 標準指標としてF1(NER)、正答率(POSおよび依存性パーサー)を測定し、clozeタスクの開発用パーセプレキシティを用いて学習ダイナミクスを監視した。
  • サブワード分布と語彙の重複度を分析し、mBERTの事前学習信号における潜在的なバイアスを評価した。

実験結果

リサーチクエスチョン

  • RQ1mBERTは、104の言語すべてで同等の高品質な表現を学習しているのか、それとも低リソース言語が特に影響を受けるのか?
  • RQ2mBERTと比較して、低リソース言語における単語別BERTの性能はどの程度か。そして、多言語事前学習が重要な誘導的バイアスを提供しているかを示唆するか?
  • RQ3低リソース言語と言語的に関連する言語をペアにすることで、表現品質は向上するか。また、このアプローチはmBERTに近づける程度はどの程度か?
  • RQ4mBERTが低リソース言語で性能を発揮できないのは、データ不足、サブワード分布バイアス、それとも共同多言語事前学習の本質的限界に起因するのか?

主な発見

  • mBERTは、事前学習リソースの下位30%の言語において、非BERTベースラインよりも顕著に性能が劣り、一部の低リソース言語ではF1スコアがランダムベースラインモデルよりも低いことが判明した。
  • mBERTと同一の低リソースコーパスで訓練された単語別BERTは、テストした4つの低リソース言語(モンゴル語、ヨルバ語、ラトビア語、アフリカン語)すべてでmBERTに劣り、多言語事前学習が不可欠な誘導的バイアスを提供していることを示している。
  • 低リソース言語と関連する高リソース言語のペア(例:アフリカン語–オランダ語)で訓練された二言語BERTモデルは、単語別BERTを上回るが、mBERTに到達しない。mBERTの多言語的誘導的バイアスは、二項ペア学習を上回る強さであることが示唆される。
  • 単語別BERTの低リソース言語における性能は、学習ダイナミクスと相関している:clozeタスクの開発用パーセプレキシティが早期に平坦化する場合、下流性能は停滞する。これは、データ不足と過学習の兆候である。
  • ラトビア語やアフリカン語のような中程度リソースの言語では、継続的学習により性能が向上する。これは、より長い訓練と大きなバッチサイズで単語別BERTをさらに向上可能であるが、低リソース言語ではデータ制限のため実現不可能である。
  • シーケンス長を短くし、バッチサイズを大きくした小さなBERTモデルが、低リソース言語では大きなモデルを上回る性能を示した。これは、低リソース環境ではモデルサイズよりもデータ効率がより重要であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。