Skip to main content
QUICK REVIEW

[論文レビュー] L3Cube-HindBERT and DevBERT: Pre-Trained BERT Transformer models for Devanagari based Hindi and Marathi Languages

Raviraj Joshi|arXiv (Cornell University)|Nov 21, 2022
Natural Language Processing Techniques被引用数 15
ひとこと要約

本稿では、ヒンディー語およびマラティ語のための大量のデヴァナガリー文字によるコーパスを用いて事前学習された単言語 BERT モデル、L3Cube-HindBERT と DevBERT を紹介する。それぞれ 18 億語 token および 25 億語 token で学習されたこれらのモデルは、ムリル、XLM-R、インディックBERT といった多言語モデルと比較して、ヒンディー語およびマラティ語のテキスト分類および固有表現抽出タスクで優れた性能を示し、十分な単言語データが利用可能な場合には単言語事前学習が優れた性能をもたらすことを示している。

ABSTRACT

The monolingual Hindi BERT models currently available on the model hub do not perform better than the multi-lingual models on downstream tasks. We present L3Cube-HindBERT, a Hindi BERT model pre-trained on Hindi monolingual corpus. Further, since Indic languages, Hindi and Marathi share the Devanagari script, we train a single model for both languages. We release DevBERT, a Devanagari BERT model trained on both Marathi and Hindi monolingual datasets. We evaluate these models on downstream Hindi and Marathi text classification and named entity recognition tasks. The HindBERT and DevBERT-based models show significant improvements over multi-lingual MuRIL, IndicBERT, and XLM-R. Based on these observations we also release monolingual BERT models for other Indic languages Kannada, Telugu, Malayalam, Tamil, Gujarati, Assamese, Odia, Bengali, and Punjabi. These models are shared at https://huggingface.co/l3cube-pune .

研究の動機と目的

  • 既存の単言語ヒンディー語 BERT モデルが、多言語モデルと比較して下流の NLP タスクで性能が劣っている問題に対処すること。
  • ヒンディー語とマラティ語が共通のデヴァナガリー文字を使用していることを利用し、両言語に適した統合された BERT モデル(DevBERT)を1つに統合して学習すること。
  • 高品質な単言語事前学習モデルを提供することで、インドの低リソース言語の NLP タスクの性能を向上させること。
  • カナーダ語、テルグ語、タミル語を含む9つの追加インディック言語に対しても、単言語 BERT モデルを拡張してリリースすること。
  • Hugging Face モデルハブを通じて、研究者や実務家が利用可能な公開リソースを提供すること。

提案手法

  • マスクド言語モデルを用いて、180 億語 token の単語ヒンディー語テキストを用いて L3Cube-HindBERT を BERT アーキテクチャで事前学習した。
  • ヒンディー語とマラティ語の単語テキストを合わせた 250 億語 token を用いて、共通の文字体系と言語的類似性を活用して DevBERT を事前学習した。
  • 標準的な NLP ベンチマークを用いて、下流の分類および固有表現抽出タスクでモデルを微調整した。
  • 相互運用性と使いやすさを考慮し、一貫したアーキテクチャとトークナイザー設計を採用して Hugging Face を通じてモデルをリリースした。
  • カスタムトークナイザーと大規模な単語テキストコーパスを用いて、9つの他のインディック言語についても、スクラッチから単語 BERT モデルを学習した。
  • 標準データセットを用いて、多言語モデル(ムリル、XLM-R、インディックBERT)および既存の単語モデル(マハBERT)と比較して性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1大規模なヒンディー語コーパスを用いて事前学習された単語ヒンディー語 BERT モデルは、既存の多言語モデルよりもヒンディー語 NLP タスクで優れた性能を示せるか?
  • RQ2ヒンディー語とマラティ語が共通のデヴァナガリー文字を使用していることを踏まえ、両言語のデータを1つの BERT モデル(DevBERT)で学習することで、両言語で競争力のある性能が得られるか?
  • RQ3L3Cube-HindBERT と DevBERT の性能は、ムリル、XLM-R、インディックBERT といった最先端の多言語モデルと比較して、ヒンディー語およびマラティ語の下流タスクでどのように異なるか?
  • RQ4カーナータ、テルグ語、マラヤーラム語などの他の低リソースインド言語に対しても、単語 BERT モデルを効果的に学習・リリースすることで NLP の性能が向上するか?
  • RQ5十分な単語データが利用可能な状況では、単語モデルを1つの言語に特化して微調整する方が、多言語モデルを使用するよりも優れた結果が得られるか?

主な発見

  • L3Cube-HindBERT は、IITP ヒンディー映画レビュー分類データセットで 69.00% の正答率を達成し、ムリル(66.00%)、XLM-R(67.00%)、インディックBERT(65.00%)を上回った。
  • DevBERT は、L3Cube-MahaNER マラティ語 NER データセットでマクロ-F1 スコア 88.31 を記録し、マハBERT(88.00)および他の多言語モデルを上回った。
  • ヒンディー語 WikiAnn NER タスクでは、DevBERT がマクロ-F1 スコア 85.00 を達成し、ムリル(84.90)、XLM-R(83.04)、インディックBERT(82.65)を上回った。
  • L3Cube-HindBERT は、ヒンディー語テキスト分類タスクで、次に優れた多言語モデル(XLM-R)と比較して 2.00 パcentage point の向上を示した。
  • DevBERT は、L3Cube-MahaSent マラティ語センチメント分類タスクで 85.00% の正答率を達成し、ムリル(84.30%)と XLM-R(82.00%)を上回った。
  • 著者らは、カナーダ語、テルグ語、マラヤーラム語、タミル語、グジャラート語、アッサム語、オーディア語、ベンガル語、パンジャーブ語の9つの追加インディック言語用の単語 BERT モデルをリリースした。これらはすべて Hugging Face で公開されており、一般利用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。