[論文レビュー] Exploring Transformer Based Models to Identify Hate Speech and Offensive Content in English and Indo-Aryan Languages
この論文は、特にXLM-RoBERTa-largeを用いて、英語およびインド=アリヤン語(ヒンディ語、マラーティー語、コードミックス)における嫌がらせ発言および攻撃的コンテンツの検出を評価している。FIRE 2021共同タスクのデータを用い、クラスウェイトとファインチューニングを適用することで、コードミックス(マクロF1スコア:0.7107)およびヒンディ語2クラス(0.7797)で2位、マラーティー語で3位(0.8756)を達成し、mBERT や専用モデル(例:IndicBERT)を上回った。
Hate speech is considered to be one of the major issues currently plaguing online social media. Repeated and repetitive exposure to hate speech has been shown to create physiological effects on the target users. Thus, hate speech, in all its forms, should be addressed on these platforms in order to maintain good health. In this paper, we explored several Transformer based machine learning models for the detection of hate speech and offensive content in English and Indo-Aryan languages at FIRE 2021. We explore several models such as mBERT, XLMR-large, XLMR-base by team name "Super Mario". Our models came 2nd position in Code-Mixed Data set (Macro F1: 0.7107), 2nd position in Hindi two-class classification(Macro F1: 0.7797), 4th in English four-class category (Macro F1: 0.8006) and 12th in English two-class category (Macro F1: 0.6447).
研究の動機と目的
- 低リソースなインド=アリヤン語(ヒンディ語、マラーティー語、英語-ヒンディ語のコードミックス)における嫌がらせおよび攻撃的発言の検出という課題に対処すること。
- 低リソース環境における嫌がらせ検出の文脈で、多言語および多言語特化型のトランスフォーマーモデルの有効性を評価すること。
- 低リソース言語分類におけるデータの不均衡とデータバランス化技術の影響を、モデルのパフォーマンスに与える影響を調査すること。
- mBERT、XLM-RoBERTa、IndicBERT、dehateBERT などの最先端モデルを、多言語および低リソース文脈で比較すること。
- 特に低リソース言語シナリオにおいて、異なるランダムシードに対するモデルの頑健性を分析すること。
提案手法
- FIRE 2021 共同タスクのデータセットを用い、XLM-RoBERTa-base、XLM-RoBERTa-large、mBERT-base、IndicBERT、dehateBERT などの多言語トランスフォーマーモデルをファインチューニングした。
- 2クラス分類(HOF 対 NOT)および4クラス分類(HATE、OFFN、PRFN、NONE)の両タスクにおいて、データの不均衡を軽減するためにクラスウェイトを適用した。
- Hugging Face と PyTorch を用いて、Adam 最適化法と交差エントロピー損失関数を用い、20エポックのファインチューニングでモデルを学習した。
- コードミックスデータのパフォーマンス向上を図るため、カスタムファインチューニングを施した XLM-RoBERTa-large を採用した。
- 複数の言語およびタスク設定(英語、ヒンディ語、マラーティー語、コードミックスデータ)を想定し、マクロF1スコアを用いてモデルを評価した。
- 複数のランダムシードを用いた実験により、モデルの安定性および実行間でのパフォーマンスのばらつきを評価した。
実験結果
リサーチクエスチョン
- RQ1多言語トランスフォーマーモデルは、ヒンディ語 や マラーティー語 などの低リソースなインド=アリヤン語において、嫌がらせおよび攻撃的コンテンツをどれほど効果的に検出できるか?
- RQ2低リソースな嫌がらせ検出の文脈において、XLM-RoBERTa-large、mBERT、および専用モデル(例:IndicBERT や dehateBERT)の相対的な有効性はいかほどか?
- RQ3多言語嫌がらせ検出における不均衡データセットにおいて、クラスウェイトはどの程度モデルパフォーマンスを向上させるか?
- RQ4特に XLM-RoBERTa と mBERT に対して、異なるランダムシードにおけるパフォーマンスの安定性はどの程度か?
- RQ5この低リソース環境において、インド語専用や嫌がらせ検出に特化したモデル(例:IndicBERT や dehateBERT)が、一般多言語モデルに比べてパフォーマンスを発揮できない理由は何か?
主な発見
- XLM-RoBERTa-large は、英語4クラス分類タスクでマクロF1スコア0.8006を達成し、コンテストで2位を獲得した。
- ヒンディ語2クラス分類では、mBERT がマクロF1スコア0.7797を記録し、最高のパフォーマンスを示し、全体で2位となった。
- コードミックスデータでは、カスタムファインチューニングを施した XLM-RoBERTa-large がマクロF1スコア0.7107を達成し、共同タスクで2位となった。
- コンテスト後評価において、XLM-RoBERTa-large はマラーティー語データセットでマクロF1スコア0.8756を達成し、3位チームと同等の成績を収めた。
- XLM-RoBERTa モデルは、ランダムシードによるパフォーマンスのばらつきが著しく小さく(最大1〜2%の変動)、mBERT(6〜7%の変動)に比べてはるかに安定していた。
- IndicBERT や dehateBERT は、インド語や嫌がらせ検出に特化したモデルとして設計されてはいるが、XLM-RoBERTa や mBERT に比べてパフォーマンスが低かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。