[論文レビュー] BERTifying Sinhala -- A Comprehensive Analysis of Pre-trained Language Models for Sinhala Text Classification
本稿では、スィネーラ語のテキスト分類のための事前学習済み言語モデルの包括的評価を提示し、より大きなコーパスで学習された2つの新しいRoBERTaベースの単語言語モデル(SinBERT-small および SinBERT-large)を導入した。結果として、XLM-R-largeが強力なベースラインとして全モデルを上回ったが、特にラベル付きデータが限られた状況では、SinBERTモデルがXLM-R-baseを上回り、4つのスィネーラ語テキスト分類タスクにおいて新たな最先端のベースラインを確立した。
This research provides the first comprehensive analysis of the performance of pre-trained language models for Sinhala text classification. We test on a set of different Sinhala text classification tasks and our analysis shows that out of the pre-trained multilingual models that include Sinhala (XLM-R, LaBSE, and LASER), XLM-R is the best model by far for Sinhala text classification. We also pre-train two RoBERTa-based monolingual Sinhala models, which are far superior to the existing pre-trained language models for Sinhala. We show that when fine-tuned, these pre-trained language models set a very strong baseline for Sinhala text classification and are robust in situations where labeled data is insufficient for fine-tuning. We further provide a set of recommendations for using pre-trained models for Sinhala text classification. We also introduce new annotated datasets useful for future research in Sinhala text classification and publicly release our pre-trained models.
研究の動機と目的
- スィネーラ語のテキスト分類のための既存の多言語事前学習モデル(XLM-R、LaBSE、LASER)および新たに訓練された単語言語モデルの性能を評価すること。
- 低リソースのスィネーラ語(リソースが限られたクラス1言語)における事前学習モデルの実証的評価が不足しているという問題を解決すること。
- 微調整済み事前学習モデルを用いて、スィネーラ語のテキスト分類のための強力で公開可能なベースラインを確立すること。
- 今後の研究を支援するため、新しいアノテート済みデータセットおよび事前学習モデルを公開すること。
提案手法
- より大きなスィネーラ語コーパスを用いて、RoBERTaベースの単語言語モデル(SinBERT-small および SinBERT-large)を事前学習した。
- 感情分析、ニュースソース分類、ニュースカテゴリ分類、およびライティングスタイル分類の4つのテキスト分類タスクで性能を評価した。
- ラベル付きデータセットのサイズを変化させながら微調整を行い、データが限られた状況でのモデルの頑健性を評価した。
- 全タスクにおいて、単語言語モデル(SinBERT)と多言語モデル(XLM-R、LaBSE、LASER)の性能を比較した。
- 主評価指標としてマクロ-F1スコアを用い、異なるデータセットサイズにおけるモデルの挙動を分析した。
- Hugging FaceおよびHugging Face Datasetsを通じて、事前学習モデル、微調整済みモデル、アノテート済みデータセット、トレーニングコードを公開した。
実験結果
リサーチクエスチョン
- RQ1多言語モデルの中でスィネーラ語を含むものの中で、スィネーラ語のテキスト分類において最も優れた性能を示すのはどれか?
- RQ2新たに事前学習された単語言語モデルのスィネーラ語のテキスト分類タスクにおける性能は、既存の多言語モデルおよび単語言語モデルと比べてどうか?
- RQ3スィネーラ語のテキスト分類において、ラベル付き微調整データのサイズが異なる場合、モデルの性能はどのように変化するか?
- RQ4ラベル付きデータが限られた状況で、単語言語モデルが多言語モデルを上回ることができるか?
- RQ5スィネーラ語のテキスト分類において、最も効果的なモデル構成とハイパーパramータは何か?
主な発見
- XLM-R-largeは感情分析タスクで最高のマクロ-F1スコア68.1を達成し、新たな強力なベースラインを確立した。
- ラベル付きデータが少ない状況で微調整した場合、SinBERT-smallは感情分析タスクでマクロ-F153.85を達成し、XLM-R-baseを上回った。
- SinBERT-largeはライティングスタイル分類タスクでマクロ-F195.49を達成し、他のすべてのモデルを上回った。
- XLM-R-largeは全4タスクにおいて一貫して他のすべてのモデルを上回り、新たな最先端のベースラインを確立した。
- 極めて小さなラベル付きデータセットの場合、SinBERT-smallおよびSinBERT-largeはXLM-R-baseを著しく上回り、より優れたデータ効率性を示した。
- 新たに公開されたスィネーラ語のニュースソース分類、ニュースカテゴリ分類、ライティングスタイル分類のデータセットは、今後の研究のために公開されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。