[論文レビュー] Abusive and Threatening Language Detection in Urdu using Boosting based and BERT based models: A Comparative Approach
本稿では、FIRE 2021共有タスクのデータセットを用いて、ウルドゥー語におけるいかり言語および脅し言語の検出について、ブースティングベースとBERTベースのモデルを比較する研究を提案する。元々アラビア語の嫌がらせ発言で訓練されたdehatebert-mono-arabicモデルを微調整した結果、最先端の性能を達成し、いかり言語検出でF1スコア0.88062、脅し言語検出でF1スコア0.54574を記録し、FIRE 2021共有タスクの両サブタスクで1位となった。
Online hatred is a growing concern on many social media platforms. To address this issue, different social media platforms have introduced moderation policies for such content. They also employ moderators who can check the posts violating moderation policies and take appropriate action. Academicians in the abusive language research domain also perform various studies to detect such content better. Although there is extensive research in abusive language detection in English, there is a lacuna in abusive language detection in low resource languages like Hindi, Urdu etc. In this FIRE 2021 shared task - "HASOC- Abusive and Threatening language detection in Urdu" the organizers propose an abusive language detection dataset in Urdu along with threatening language detection. In this paper, we explored several machine learning models such as XGboost, LGBM, m-BERT based models for abusive and threatening content detection in Urdu based on the shared task. We observed the Transformer model specifically trained on abusive language dataset in Arabic helps in getting the best performance. Our model came First for both abusive and threatening content detection with an F1scoreof 0.88 and 0.54, respectively.
研究の動機と目的
- 低リソース言語としてのウルドゥー語におけるいかり的および脅し的言語検出に関する研究の不足に対処すること。
- 古典的機械学習モデル(XGBoost、LGBM)とトランスフォーマー基盤モデル(mBERT、dehatebert-mono-arabic)が、ウルドゥー語のいかり的および脅し的言語検出にどの程度効果的であるかを評価すること。
- 言語的および歴史的関連性を考慮して、アラビア語の嫌がらせ発言データで事前学習されたモデルを微調整することで、ウルドゥー語での性能が向上するかどうかを調査すること。
- FIRE 2021共有タスクにおけるウルドゥー語のいかり的および脅し的言語検出で最良のパフォーマンスを達成すること。
- 今後の低リソース嫌がらせ発言検出研究を支援するために、コードとモデルを公開すること。
提案手法
- ベースラインモデルとして、事前学習済みウルドゥー語LASER埋め込みを用いたXGBoostおよびLightGBMを採用した。
- 二値分類のため、ウルドゥー語のいかり的および脅し的言語データセット上で多言語BERT(mBERT)を微調整した。
- アラビア語の嫌がらせ発言データで事前微調整済みのdehatebert-mono-arabicモデルを、言語的類似性を活用してウルドゥー語への転移学習に用いた。
- 両サブタスクに二値クロスエントロピー損失を適用し、脅し言語検出データセットにおけるデータの不均衡を軽減するためにクラスウェイトを導入した。
- トランスフォーマー・モデルには、10エポック、Adam最適化法、初期値2e-5の初期学習率を用い、検証F1スコアに基づく早期停止を実施した。
- いかり言語検出ではトレーニングデータを85%を学習用、15%を検証用に分割したが、脅し言語検出ではデータの不均衡のため、全データセットを用いた。
実験結果
リサーチクエスチョン
- RQ1XGBoost や LGBM といったブースティングベースのモデルは、低リソースのウルドゥー語テキストにおいて、いかり的および脅し的言語を効果的に検出できるか?
- RQ2mBERT をウルドゥー語データで微調整することで、初期学習から行うか一般用途の埋め込みを用いるのと比較して性能が向上するか?
- RQ3言語的ルートの共通性を考慮して、アラビア語の嫌がらせ発言データで事前学習されたモデルが、ウルドゥー語にうまく一般化できるか?
- RQ4脅し言語検出データセットにおけるデータの不均衡がモデル性能に与える影響は何か?また、クラスウェイトはその影響を軽減できるか?
- RQ5FIRE 2021共有タスクにおけるウルドゥー語のいかり的および脅し的言語検出において、異なるモデルの相対的パフォーマンスはどのようになるか?
主な発見
- dehatebert-mono-arabic モデルをウルドゥー語データセットで微調整した結果、いかり言語検出タスク(サブタスクA)で最高のF1スコア0.88062を記録し、共有タスクで1位となった。
- 脅し言語検出(サブタスクB)においても、同じモデルがF1スコア0.54574を達成し、他のすべてのモデルを上回り、極めて不均衡なデータセットにもかかわらず1位を獲得した。
- 古典的モデル(XGBoost と LGBM)は中程度の性能を示し、それぞれサブタスクAでF1スコア0.76072および0.76667を記録した。これは、低リソースのウルドゥー語テキストでは限界があることを示している。
- mBERT はサブタスクAでF1スコア0.84000、サブタスクBでF1スコア0.46961を達成し、古典的モデルより優れた性能を示したが、dehatebert-mono-arabic モデルに劣った。
- 本研究では、高性能なアラビア語嫌がらせ発言モデルからの転移学習が、ウルドゥー語での性能向上に顕著に寄与することを確認した。これは、関連言語間での言語的転送可能性を示唆している。
- クラスウェイトは、不均衡な脅し言語データセットにおけるモデルの頑健性を向上させたが、性能の限界は依然として残っており、このタスクにおけるデータの不均衡は依然として主要な課題であると示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。