[論文レビュー] One to rule them all: Towards Joint Indic Language Hate Speech Detection
本論文は、XLM-RoBERTaを用いた多言語微調整手法を提案し、英語、ヒンディー語、マラーティー語の3言語で同時に嫌がらせおよび攻撃的発言を検出することを目的としている。HASOC 2021共同タスクにおいて、サブタスク1Aで英語で0.7996、ヒンディー語で0.7748、マラーティー語で0.8651のマクロF1スコアを達成し、最先端の結果を示した。これは、低リソースなインディック言語における多言語学習の優位性を示している。
This paper is a contribution to the Hate Speech and Offensive Content Identification in Indo-European Languages (HASOC) 2021 shared task. Social media today is a hotbed of toxic and hateful conversations, in various languages. Recent news reports have shown that current models struggle to automatically identify hate posted in minority languages. Therefore, efficiently curbing hate speech is a critical challenge and problem of interest. We present a multilingual architecture using state-of-the-art transformer language models to jointly learn hate and offensive speech detection across three languages namely, English, Hindi, and Marathi. On the provided testing corpora, we achieve Macro F1 scores of 0.7996, 0.7748, 0.8651 for sub-task 1A and 0.6268, 0.5603 during the fine-grained classification of sub-task 1B. These results show the efficacy of exploiting a multilingual training scheme.
研究の動機と目的
- ヒンディー語やマラーティー語などの低リソースなインディック言語における嫌がらせおよび攻撃的発言の検出という課題に取り組むこと。既存のモデルはしばしば性能を発揮しない。
- 単言語モデルの限界を克服するため、言語間で共有される表現を学習できるように、複数言語を同時に微調整するアプローチを検討することで、言語間の一般化性能を向上させること。
- 複数のインディック言語のソーシャルメディアテキストに特化した、きめ細やかな前処理パイプラインの開発と評価。
- データオーバースアンプリングや代替アーキテクチャの有効性を検証し、不均衡なデータセットにおける性能向上を図ること。
- 英語、ヒンディー語、マラーティー語における嫌がらせおよび攻撃的コンテンツ検出のHASOC 2021共同タスクで、競争力のある結果を達成すること。
提案手法
- 英語、ヒンディー語、マラーティー語の3言語を同時に微調整できるように、多言語トランスフォーマーに基づく言語モデルXLM-RoBERTaを採用した。
- 同じモデルを3言語すべてに対して同時に微調整する統合的多言語学習スキームを適用し、言語表現を共有するようにした。
- インディック言語で一般的な絵文字、スラング、ミックススクリプトテキストに対応するため、ソーシャルメディアテキストの正規化を目的とした前処理パイプラインを実装した。
- データの不均衡を緩和するために、SOUP(類似度ベースのオーバーサンプリングおよびアンダーサンプリング)を用いたクラスバランス技術を適用した。
- GoogleのNMT APIを用いたバックトランスレーションによるデータ拡張を検討したが、性能が低下する結果となった。
- mBERT や DistilBERT といった複数のモデルを用いて、単言語と多言語微調整戦略を比較し、多言語事前学習の利点を特定した。
実験結果
リサーチクエスチョン
- RQ11つの多言語トランスフォーマーモデルが、英語、ヒンディー語、マラーティー語の3言語で、同等の性能で嫌がらせおよび攻撃的発言を共同で検出可能か?
- RQ2低リソースなインディック言語において、多言語微調整は単言語微調整に比べてF1スコアおよび耐性の面で優れているか?
- RQ3バックトランスレーションのようなデータ拡張技術は、低リソースな嫌がらせ検出においてモデルの一般化性能をどの程度向上させるか?
- RQ4なぜ、TF-IDF や SVM、ランダムフォレストなどの古典的NLPアプローチは、インディック言語のソーシャルメディアテキストではトランスフォーマーに基づくモデルに比べて性能が劣るのか?
- RQ5限られたアノテーションデータしかない低リソースのインディック言語に多言語モデルを適応させるにあたり、主な課題は何か?
主な発見
- 多言語微調整済みXLM-RoBERTaモデルは、サブタスク1Aにおいてマラーティー語で最高のマクロF1スコア0.8651を達成し、他のすべてのモデルやアプローチを上回った。
- サブタスク1Aにおいて、多言語XLM-RoBERTaモデルは英語で0.7996、ヒンディー語で0.7748、マラーティー語で0.8651のマクロF1スコアを記録し、このタスクでHASOC 2021ランクイング1位を獲得した。
- 多言語アプローチにより、サブタスク1Aで単言語微調整に比べてF1スコアが2.1ポイントの絶対的向上を達成し、共有表現学習の有効性を示した。
- バックトランスレーションによるデータ拡張は、性能の低下を引き起こし、誤ったラベルの導入を招いた。これは、分布シフトや信頼性の問題を示唆している。
- ランダムフォレストやLightGBMのような古典的モデルは、最良のトランスフォーマー基盤モデルと比較して平均5.3%の性能低下を示した。これは、ソーシャルメディアテキストに対して従来の機械学習手法の限界を示している。
- SOUPによるデータバランス化を実施したにもかかわらず、最良のモデルと比較して性能が5%低下した。これは、クラス不均衡がこの設定における主なボトルネックではないことを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。