[論文レビュー] A Twitter BERT Approach for Offensive Language Detection in Marathi
この論文は、マーラチ語のツイートとHASOC 2021およびL3Cube-MahaHateからのデータ拡張を用いたドメイン固有の事前学習により、微調整されたMahaTweetBERTモデルを提案する。このモデルは、HASOC 2022テストセットで98.43の新しい最先端のF1スコアを達成し、低リソース環境におけるソーシャルメディアの攻撃的言語検出において、マーラチ語ツイッターBERTモデルが一般多言語および攻撃的データ特化型BERTよりも優れていることを示している。
Automated offensive language detection is essential in combating the spread of hate speech, particularly in social media. This paper describes our work on Offensive Language Identification in low resource Indic language Marathi. The problem is formulated as a text classification task to identify a tweet as offensive or non-offensive. We evaluate different mono-lingual and multi-lingual BERT models on this classification task, focusing on BERT models pre-trained with social media datasets. We compare the performance of MuRIL, MahaTweetBERT, MahaTweetBERT-Hateful, and MahaBERT on the HASOC 2022 test set. We also explore external data augmentation from other existing Marathi hate speech corpus HASOC 2021 and L3Cube-MahaHate. The MahaTweetBERT, a BERT model, pre-trained on Marathi tweets when fine-tuned on the combined dataset (HASOC 2021 + HASOC 2022 + MahaHate), outperforms all models with an F1 score of 98.43 on the HASOC 2022 test set. With this, we also provide a new state-of-the-art result on HASOC 2022 / MOLD v2 test set.
研究の動機と目的
- 低リソースのインディック言語、特にマーラチ語において、ソーシャルメディアの嫌がらせ発言が精神的健康と社会的調和に悪影響を及えるという課題に対処すること。
- 特にマーラチ語のソーシャルメディアテキストで事前学習されたモデルが、攻撃的言語識別にどの程度効果的であるかを評価すること。
- 攻撃的コンテンツのみで事前学習されたモデルが、より広範なマーラチ語ツイートコーパスで事前学習されたモデルを上回るかどうかを調査すること。
- 複数の外部マーラチ語嫌がらせ発言データセットを用いたデータ拡張によって、モデルの汎化性能と性能が向上するかどうかを検討すること。
提案手法
- HASOC 2022、HASOC 2021、およびL3Cube-MahaHateデータセットの組み合わせ学習セット上で、MahaTweetBERT、MahaTweetBERT-Hateful、MahaBERT、MuRIL、およびMarathiBert V2の複数のBERTモデルを微調整した。
- モデルはドメインの関連性に応じて選択された:MahaTweetBERTおよびMahaTweetBERT-Hatefulは、攻撃的コンテンツを含む大規模なマーラチ語ツイートで事前学習されている。
- データ拡張として、3つの異なるマーラチ語嫌がらせ発言データセット(HASOC 2021、HASOC 2022、L3Cube-MahaHate)を組み合わせ、学習データの多様性とサイズを向上させた。
- オフェンシブおよびノンオフェンシブクラスのバランスを保つために、HASOC 2022テストセットにおけるマクロ-F1スコアを主評価指標とした。
- 訓練データの組み合わせごとの性能を比較するアブレーションスタディを実施した:HASOC 2022のみ、HASOC 2022 + HASOC 2021、およびHASOC 2022 + HASOC 2021 + MahaHate。
- 最終的なテストセット評価の前に、HASOC 2022開発セットでのバリデーション性能に基づいて最良のモデルチェックポイントを選択した。
実験結果
リサーチクエスチョン
- RQ1マーラチ語ツイッター特化型BERTモデル(MahaTweetBERT)は、マーラチ語ソーシャルメディアにおける攻撃的言語検出において、一般多言語および攻撃的データ特化型BERTモデルを上回る性能を示すか?
- RQ2複数の外部マーラチ語嫌がらせ発言データセット(HASOC 2021、L3Cube-MahaHate)を用いたデータ拡張は、HASOC 2022ベンチマークにおけるモデル性能を顕著に向上させるか?
- RQ3結合データセットで微調整されたモデルが、依然として特定の共通文を正しく分類できないのはなぜか?これはモデルの汎化限界を何を示唆するか?
- RQ4攻撃的コンテンツのみで事前学習されたBERTモデル(MahaTweetBERT-Hateful)は、低リソース環境において、混合ツイートコーパスで事前学習されたモデルを一貫して上回るか?
- RQ5一般向けまたは多言語事前学習と比較して、マーラチ語ツイートでドメイン特化型事前学習を施すことで、下流の攻撃的言語検出タスクの性能がどの程度向上するか?
主な発見
- 4000万件のマーラチ語ツイートで事前学習されたBERTモデルMahaTweetBERTは、HASOC 2022、HASOC 2021、およびL3Cube-MahaHateの組み合わせデータセットで微調整した結果、HASOC 2022テストセットで最高のF1スコア98.43を達成した。
- HASOC 2022、HASOC 2021、およびMahaHateデータセットの組み合わせは、HASOC 2022単体での学習と比較して顕著な性能向上をもたらした。これは、現在のデータスケールではモデルの性能がまだ飽和していないことを示している。
- 直感的な期待とは対照的に、攻撃的マーラチ語ツイートのみで事前学習されたMahaTweetBERT-Hatefulモデルは、より大きな混合データコーパスで学習したMahaTweetBERTよりも性能が悪く、攻撃的コンテンツのみで事前学習すると汎化性能が制限される可能性があることを示唆している。
- 結合データセットで微調整されたモデルは、同じ例を誤って分類する傾向にあり、これは訓練の仕組みに根ざしたデータバイアスやモデル収束パターンが、訓練の方法にかかわらず持続する可能性を示している。
- MahaTweetBERTモデルは、MuRILやMarathiBert V2を含む他のすべてのモデルを上回った。これは、低リソース言語の下流NLPタスクにおいて、ソーシャルメディアテキストでドメイン特化型事前学習を行う価値があることを確認している。
- 本研究は、HASOC 2022 / MOLD v2テストセットで新たな最先端の結果を確立した。MahaTweetBERTは98.43のF1スコアを達成し、マーラチ語の攻撃的言語検出において、ツイッター特化型BERTとマルチソースデータ拡張の初めての成功した応用を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。