[論文レビュー] L3Cube-MahaCorpus and MahaBERT: Marathi Monolingual Corpus, Marathi BERT Language Models, and Resources
本稿では、多様なインターネットソースから収集した2480万文、2億8900万トークンのマーラチ語単語語彙(L3Cube-MahaCorpus)を紹介し、マーラチ語の全語彙7億5200万トークンを用いて事前学習された、MahaBERT、MahaAlBERT、MahaRoBERTa、MahaGPT—これらはすべてマルチリンガルBERTベースの言語モデルと生成的GPTモデルである—を提示する。これらのモデルは、マーラチ語の下流タスクで最先端の性能を達成し、テキスト分類および名前付きエンティティ認識(NER)においてマルチリンガルベースラインを上回った。
We present L3Cube-MahaCorpus a Marathi monolingual data set scraped from different internet sources. We expand the existing Marathi monolingual corpus with 24.8M sentences and 289M tokens. We further present, MahaBERT, MahaAlBERT, and MahaRoBerta all BERT-based masked language models, and MahaFT, the fast text word embeddings both trained on full Marathi corpus with 752M tokens. We show the effectiveness of these resources on downstream Marathi sentiment analysis, text classification, and named entity recognition (NER) tasks. We also release MahaGPT, a generative Marathi GPT model trained on Marathi corpus. Marathi is a popular language in India but still lacks these resources. This work is a step forward in building open resources for the Marathi language. The data and models are available at https://github.com/l3cube-pune/MarathiNLP .
研究の動機と目的
- ニュース以外のインターネットソースから得た2480万文と2億8900万トークンを追加することで、大規模かつ多様なマーラチ語単語語彙の不足を解消すること。
- マーラチ語NLPのための高性能な単語語彙ベースのBERT言語モデル(MahaBERT、MahaAlBERT、MahaRoBERTa)と生成的MahaGPTモデルを開発すること。
- マーラチ語全語彙を用いて学習したMahaFTというfastText単語埋め込みモデルを訓練・公開すること。
- これらのリソースがマーラチ語固有のNLPタスク、特にテキスト分類、感情分析、名前付きエンティティ認識(NER)において効果的であるかを評価すること。
- 低リソースのインド語NLP分野の研究開発を支援するため、オープンソースで高品質なマーラチ語NLPリソースを提供すること。
提案手法
- ニュース以外のコンテンツも含む多様なインターネットソースから、マーラチ語単語語彙(L3Cube-MahaCorpus)を収集・整備し、データバイアスを低減すること。
- L3Cube-MahaCorpusを既存の公開マーラチ語語彙(例:IndicNLP、OSCAR、CC-100)と統合し、7億5200万トークンの学習データセットを構築すること。
- マスク言語モデル(MLM)と次文予測の目的関数を用いて、マーラチ語全語彙上で3つのBERTベースのモデル(MahaBERT、MahaAlBERT、MahaRoBERTa)を事前学習すること。
- 下流タスク(ニュース記事・見出しのテキスト分類、L3CubeMahaSentの感情分析、最終トークン埋め込みにCRF層を追加したNER)でBERTモデルを微調整すること。
- skip-gramアーキテクチャを用いて、マーラチ語全語彙上でMahaFTというfastText単語埋め込みモデルを学習し、文レベルタスクでKNN分類器を用いて評価すること。
- 自己回帰的言語モデルの目的関数を用いて、マーラチ語全語彙上でMahaGPTという生成的言語モデルを学習すること。
実験結果
リサーチクエスチョン
- RQ1既存の多くがニュースに偏った語彙と比較して、大規模かつ多様なマーラチ語単語語彙は、下流NLPタスクの性能向上に寄与するか?
- RQ2大規模かつ多様なマーラチ語語彙で微調整された単語語彙ベースのBERTモデルは、マーラチ語固有のNLPタスクにおいてマルチリンガルBERTモデルを上回る性能を示すか?
- RQ3マーラチ語全語彙上で学習されたfastText埋め込み(MahaFT)は、既存の代替手法(例:FacebookのFB-FT、IndicNLPのINLP-FT)と比較して、マーラチ語テキスト分類においてどれほど効果的か?
- RQ4単語語彙にニュース以外のコンテンツを含めることで、マーラチ語NLPモデルの頑健性と一般化性能がどの程度向上するか?
- RQ5大規模かつ整理されたマーラチ語語彙上で、生成的マーラチ語言語モデル(MahaGPT)を効果的に学習できるか?
主な発見
- MahaRoBERTaは、マーラチ語NERタスクで64.34の最高マクロ-F1スコアを達成し、mBERT(58.35)やXLM-R(62.32)といったマルチリンガルモデルを上回った。
- MahaAlBERTは、L3CubeMahaSent感情分析データセットで83.7%の最高分類精度を達成し、mBERT(80.4%)やXLM-R(82.0%)を上回った。
- マーラチ語全語彙上で学習されたfastText埋め込みモデルMahaFTは、NERタスクで91.2のマクロ-F1スコアを達成し、FB-FT(88.8)やINLP-FT(90.7)を上回った。
- MahaBERT、MahaAlBERT、MahaRoBERTaといった単語語彙ベースのBERTバリアントは、すべての分類およびNERベンチマークで、そのマルチリンガル対応モデル(mBERT、XLM-R、indicBERT)を一貫して上回った。
- 生成的トランスフォーマーであるMahaGPTモデルは、マーラチ語全語彙上で効果的に学習され、オープンソースNLPスイートの一部として公開された。
- L3Cube-MahaCorpusと既存の語彙を統合することで、7億5200万トークンのマーラチ語単語語彙データセットが構築され、低リソースのマーラチ語NLPのリソース基盤が著しく拡充された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。