Skip to main content
QUICK REVIEW

[論文レビュー] BanglaBERT: Language Model Pretraining and Benchmarks for Low-Resource Language Understanding Evaluation in Bangla

Abhik Bhattacharjee|arXiv (Cornell University)|Jan 1, 2021
Topic Modeling被引用数 6
ひとこと要約

本稿では、27.5 GB の洗練済みベンガル語ウェブテキスト('Bangla2B+')を事前学習した BERT ベースの言語モデルである BanglaBERT と、ベンガル語と英語の両方を事前学習した多言語バージョンである BanglishBERT を紹介する。著者らは、感情分析、NLI、NER、QA の4つの NLU タスクを含む、ベンガル語理解のための最初のベンチマーク(BLUB)を確立した。その結果、BanglaBERT は mBERT や XLM-R (base) よりもそれぞれ 6.8 および 4.3 BLUB ポイント高い性能を示し、ゼロショット転送性能も優れている。

ABSTRACT

In this work, we introduce BanglaBERT, a BERT-based Natural Language Understanding (NLU) model pretrained in Bangla, a widely spoken yet low-resource language in the NLP literature. To pretrain BanglaBERT, we collect 27.5 GB of Bangla pretraining data (dubbed `Bangla2B+') by crawling 110 popular Bangla sites. We introduce two downstream task datasets on natural language inference and question answering and benchmark on four diverse NLU tasks covering text classification, sequence labeling, and span prediction. In the process, we bring them under the first-ever Bangla Language Understanding Benchmark (BLUB). BanglaBERT achieves state-of-the-art results outperforming multilingual and monolingual models. We are making the models, datasets, and a leaderboard publicly available at https://github.com/csebuetnlp/banglabert to advance Bangla NLP.

研究の動機と目的

  • ベンガル語(3億人以上が話す低リソース言語)の高品質で大規模な事前学習データの不足を解決すること。
  • 既存の多言語モデルを上回る性能を示す単語言語特化型ベンガル語 NLU モデル、BanglaBERT の開発。
  • ベンガル語 NLP で未だ未開拓であった、自然言語推論および質問応答のための2つの新規ベンチマークデータセットの導入。
  • 多様な NLU タスクをカバーする包括的なベンガル語理解ベンチマーク(BLUB)の確立。
  • ベンガル語と英語の両方を事前学習することで、ゼロショットクロスリンガル転送を可能にする多言語モデル、BanglishBERT の開発。

提案手法

  • Alexa ランキング上位の110の代表的ベンガル語ウェブサイトをクロールし、35 GB の生テキストを収集。その後、フィルタリングとクリーニング処理により、27.5 GB の高品質・非攻撃的ベンガル語テキストに精錬。
  • 重複除去、HTML/JS タグの除去、言語分類による処理により、ベンガル語コンテンツを明確に分離。
  • 清浄化されたコーパス上で学習した 32k の語彙を持つ WordPiece タイライザーを構築。これにより、コードスイッチィングやローマ字表記ベンガル語もサポート。
  • 7.18M のサンプル(21.8B テンキー)を用いて、マスク言語モデル(MLM)と次文予測(NSP)の目的関数に基づき、BanglaBERT を事前学習。
  • ベンガル語と英語の両方のデータを統合して学習させることで、ゼロショットクロスリンガル転送を可能にする BanglishBERT を共同で事前学習。
  • 新しく導入された BLUB ベンチマークを用いて、感情分析、NLI、NER、QA の4つの下流タスクでモデルを評価。

実験結果

リサーチクエスチョン

  • RQ1単語言語特化型 BERT モデルが、多言語モデルと比較してベンガル語 NLU タスクで優れた性能を示せるか?
  • RQ2多言語モデル(例:BanglishBERT)を用いた英語からベンガル語へのゼロショットクロスリンガル転送は、どの程度効果的か?
  • RQ3限られたラベル付きデータ(例:≤1,000 件)で微調整する場合、ベンガル語のような低リソース NLP モデル(例:BanglaBERT)のサンプル効率はどの程度か?
  • RQ4ノイズの多いオープンソースデータセット(例:OSCAR や CCNet)と比較して、洗練済みの大規模ベンガル語コーパスを事前学習に用いることで、性能にどのような差が出るか?
  • RQ5新規ベンチマーク(BLUB)が、ベンガル語 NLP 研究の標準化および前進にどの程度寄与できるか?

主な発見

  • すべての4つのタスクにおいて、監視付き微調整の結果、BanglaBERT は mBERT より 6.8、XLM-R (base) より 4.3 BLUB ポイント高いスコアを達成。
  • ゼロショットクロスリンガル転送において、BanglishBERT は mBERT より 15.8、XLM-R (base) より 10.8 BLUB ポイント高いスコアを記録。
  • 限られた学習データ(≤1,000 件)での微調整において、感情分析では XLM-R (large) より 2–9% の高い正答率を達成、NLI では 6–10% の高い正答率を示し、p < 0.05 の有意差を示した。
  • BanglaBERT は、微調整に際して、より小さい sahajBERT モデルと比較して、2–3.5倍の時間短縮と 2.4–3.33倍のメモリ削減を実現し、計算効率に優れた性能を示した。
  • 著者らは、著作権侵害を避ける非著作権侵害型の事前学習データセットを洗練し、リリースした。加えて、NLI および QA のための2つの新規高品質下流データセットも開発・リリース。
  • モデルとベンチマークは非営利ライセンスでリリースされており、品質管理された人間翻訳パイプラインにより、データセットの信頼性が保証されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。