Skip to main content
QUICK REVIEW

[論文レビュー] BanglaBERT: Combating Embedding Barrier in Multilingual Models for Low-Resource Language Understanding

Abhik Bhattacharjee, Tahmid Hasan|arXiv (Cornell University)|Jan 1, 2021
Topic Modeling参考文献 44被引用数 11
ひとこと要約

本論文では、18.6 GB のバングラ語テキストを微調整した多言語言語モデル BanglaBERT を紹介し、独自の script を持つ低リソース言語におけるパフォーマンス低下(「埋め込み障壁」)を解消することを目的としている。バングラ語を共通の script に変換することで、モデルのパフォーマンスが向上し、5 つの NLU タスクおよび新しいバングラ語 NLI データセットで最先端の結果を達成しており、従来モデル比最大 3.5% の向上を実現した。

ABSTRACT

In this paper, we introduce ``Embedding Barrier'', a phenomenon that limits the monolingual performance of multilingual models on low-resource languages having unique typologies. We build `BanglaBERT', a Bangla language model pretrained on 18.6 GB Internet-crawled data and benchmark on five standard NLU tasks. We discover a significant drop in the performance of the state-of-the-art multilingual model (XLM-R) from BanglaBERT and attribute this to the Embedding Barrier through comprehensive experiments. We identify that a multilingual model's performance on a low-resource language is hurt when its writing script is not similar to any of the high-resource languages. To tackle the barrier, we propose a straightforward solution by transcribing languages to a common script, which can effectively improve the performance of a multilingual model for the Bangla language. As a bi-product of the standard NLU benchmarks, we introduce a new downstream dataset on natural language inference (NLI) and show that BanglaBERT outperforms previous state-of-the-art results on all tasks by up to 3.5%. We are making the BanglaBERT language model and the new Bangla NLI dataset publicly available in the hope of advancing the community. The resources can be found at \url{https://github.com/csebuetnlp/banglabert}.

研究の動機と目的

  • 独自の script を持つ低リソース言語における多言語モデルの性能低下を引き起こす「埋め込み障壁」という現象を特定・解明すること。
  • 独自の script を持つ低リソース言語であるバングラ語における、多言語モデルの単語レベルパフォーマンスを向上させること。
  • 共通の script への script 変換を用いた実用的解決策を提案し、言語間の転送性能を向上させること。
  • 新たに公開された NLI データセットを用いて、バングラ語自然言語理解のための新しいベンチマークを確立すること。

提案手法

  • インターネットクロールで得た 18.6 GB のバングラ語テキストを用いて、BERT をベースとしたモデルを事前学習し、BanglaBERT を作成する。
  • 多言語モデルにおける高リソース言語とは顕著に異なる script を持つ言語が、パフォーマンスに与える影響を定義し、実証的に検証する。「埋め込み障壁」としての概念を明確化する。
  • 変換ベースの解決策を提案:バングラ語テキストを共通の script(例:ラテン文字)に変換することで、多言語埋め込みとの整合性を高める。
  • 5 つの標準 NLU タスク、ならびに新たに導入された自然言語推論(NLI)データセットに対して、BanglaBERT を微調整する。
  • 複数のベンチマークで、XLM-R および従来の最先端モデルと比較して BanglaBERT のパフォーマンスを評価する。
  • 訓練済みモデルおよび新たに導入されたバングラ語 NLI データセットを公開し、コミュニティ研究を支援する。

実験結果

リサーチクエスチョン

  • RQ1独自の script を持つ低リソース言語(例:バングラ語)において、「埋め込み障壁」が多言語モデルのパフォーマンスにどの程度悪影響を及えるか?
  • RQ2バングラ語を共通の script に変換することで、多言語モデルのバングラ語 NLU タスクにおけるパフォーマンスが顕著に向上するか?
  • RQ3標準的なバングラ語 NLU ベンチマークにおいて、BanglaBERT は XLM-R や従来の最先端モデルと比べてどの程度優れているか?
  • RQ4従来のモデルと比較して、新たに導入されたバングラ語 NLI データセットで BanglaBERT がどの程度の改善を達成しているか?
  • RQ5提案された変換ベースの手法は、ラテン文字以外の script を持つ他の低リソース言語に対しても一般化可能か?

主な発見

  • BanglaBERT は、5 つの標準 NLU タスクすべてで XLM-R を上回り、埋め込み障壁を克服したことで顕著な性能向上を示した。
  • XLM-R におけるバングラ語のパフォーマンス低下は、明確に script の不一致に起因しており、埋め込み障壁の存在を裏付けた。
  • バングラ語テキストを共通の script に変換することで、多言語モデルの整合性が向上し、下流タスクでの測定可能なパフォーマンス向上が得られた。
  • BanglaBERT は、評価されたすべてのタスクで最先端の結果を達成しており、従来モデル比最大 3.5% の向上を実現した。
  • 新たに導入されたバングラ語 NLI データセットは、今後のバングラ語自然言語理解分野の研究における標準的ベンチマークを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。