Skip to main content
QUICK REVIEW

[論文レビュー] L3Cube-MahaNLP: Marathi Natural Language Processing Datasets, Models, and Library

Raviraj Joshi|arXiv (Cornell University)|May 29, 2022
Natural Language Processing Techniques被引用数 9
ひとこと要約

L3Cube-MahaNLP は、マラチ語 NLP リソースの包括的なスイートを初めて提供する。これには、単語語彙データセット(MahaCorpus)、タスク固有のデータセット(MahaSent、MahaNER、MahaHate)、およびそれらに対応する微調整済み BERT、RoBERTa、ALBERT、GPT モデルが含まれる。本研究は、マラチ語の感情分析、固有表現抽出、嫌がらせ発言検出において最先端の性能を確立し、Hugging Face および GitHub を通じて公開されたモデルにより、低リソースのマラチ語 NLP アプリケーションの本番環境利用を支援する。

ABSTRACT

Despite being the third most popular language in India, the Marathi language lacks useful NLP resources. Moreover, popular NLP libraries do not have support for the Marathi language. With L3Cube-MahaNLP, we aim to build resources and a library for Marathi natural language processing. We present datasets and transformer models for supervised tasks like sentiment analysis, named entity recognition, and hate speech detection. We have also published a monolingual Marathi corpus for unsupervised language modeling tasks. Overall we present MahaCorpus, MahaSent, MahaNER, and MahaHate datasets and their corresponding MahaBERT models fine-tuned on these datasets. We aim to move ahead of benchmark datasets and prepare useful resources for Marathi. The resources are available at https://github.com/l3cube-pune/MarathiNLP.

研究の動機と目的

  • インドで3番目に多く話されている言語であるマラチ語の NLP リソースの著しい不足に対処する。これは、広範に使用されているにもかかわらず、依然としてリソースが不足している。
  • 実用的品質のデータセットとモデルを開発し、実世界の有用性に欠ける小さなベンチマークデータセットにとどまらないようにする。
  • 学術的・産業的応用を支援するため、マラチ語 NLP 専用のオープンソースライブラリとエコシステムを構築する。
  • マルチリンガル代替品を上回る性能を発揮する、マラチ語固有の事前学習モデル(MahaBERT、MahaRoBERTa、MahaAlBERT)および生成モデル(MahaGPT)を確立する。
  • Hugging Face を通じたモデル公開および将来の pip パッケージ統合により、エンドツーエンドの NLP パイプラインを実現する。

提案手法

  • MahaCorpus を構築した。これは、289Mトークンの単語語彙マラチ語コーパス(外部ソースを含めると合計752Mトークン)であり、非教師あり事前学習用である。
  • MahaCorpus を用いて、マルチリンガル BERT の変種(base-BERT、RoBERTa、ALBERT)を微調整し、マスク言語モデル(MLM)を用いて MahaBERT、MahaRoBERTa、MahaAlBERT モデルを生成した。
  • MahaGPT を開発した。これは、マラチ語コーパスを用いて学習された、GPT-2 形式の因果的言語モデルであり、自動補完およびテキスト生成タスクに適している。
  • MahaFT を生成した。これは、マラチ語コーパスを用いて学習された fastText 単語埋め込みであり、語彙外語の取り扱いを向上させる。
  • MahaSent(12,114 件のツイート)、MahaNER(25,000 文)、MahaHate(25,000 件のツイート)のデータセットを手動で編集し、感情分析、固有表現抽出、嫌がらせ発言分類に特化した。
  • 各データセットで BERT および RoBERTa モデルを微調整し、Hugging Face Hub に公開して、直接推論や微調整が可能にした。

実験結果

リサーチクエスチョン

  • RQ1大規模な単語語彙マラチ語コーパスは、マルチリンガル事前学習と比較して、下流 NLP タスクの性能を顕著に向上させるのか?
  • RQ2専用のタスク固有データセットおよび微調整済みモデルは、実世界のマラチ語 NLP 応用において、一般的なベンチマークを上回る性能を発揮するのか?
  • RQ3マルチリンガルモデル(例:multilingual-BERT や XLM-R)と比較して、マラチ語固有の BERT 変種(MahaBERT、MahaRoBERTa、MahaAlBERT)は、マラチ語 NLP タスクでどれほど効果的か?
  • RQ4MahaGPT および MahaFT は、低リソースのマラチ語 NLP における系列モデリングおよび単語表現をどれほど向上させるのか?
  • RQ5標準化された、本番環境対応のデータセットおよびモデルの公開は、マラチ語 NLP の研究および展開をどれほど加速させるのか?

主な発見

  • MahaBERT モデルは、マラチ語の下流タスクにおいてマルチリンガル BERT や XLM-R を上回り、単語語彙事前学習の利点を示した。
  • MahaCorpus は、289M トークン(外部ソースを含めると合計 752M トークン)を有し、マラチ語における非教師ありおよび教師あり事前学習の強固な基盤を提供する。
  • MahaSent、MahaNER、MahaHate は、マラチ語における感情分析、固有表現抽出、嫌がらせ発言検出のための、初めての大規模でゴールドスタンダードのデータセットである。
  • MahaSent、MahaNER、MahaHate のための微調整済み BERT モデルは、それぞれのタスクで最先端の性能を達成しており、Hugging Face を通じて公開されている。
  • MahaGPT は、マラチ語における次トークン予測およびテキスト生成を可能にし、言語としての最初の生成モデルである。
  • MahaFT 単語埋め込みは、特に語形変化が複雑な語に対して、既存のマラチ語単語ベクトルよりも優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。