Skip to main content
QUICK REVIEW

[論文レビュー] Overview of Abusive and Threatening Language Detection in Urdu at FIRE 2021

Maaz Amjad, Alisa Zhila|arXiv (Cornell University)|Jul 14, 2022
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

本論文は、ウルドゥー語におけるいじめおよび脅し行為の検出を目的とした共有課題を提示し、手作業でアノテートされた2つのデータセットを導入した。暴言検出用に2,400件のトレーニングおよび1,100件のテストツイート、脅し検出用に6,000件のトレーニングおよび3,950件のテストツイートを提供した。最良のパフォーマンスを示したシステムは、多言語Bert(m-BERT)モデルを用いており、暴言検出タスクでF1スコア0.880、脅し検出タスクでF1スコア0.545を達成した。これは、トランスフォーマーに基づくモデルが低リソースのウルドゥー語NLPタスクにおいて有効であることを示している。

ABSTRACT

With the growth of social media platform influence, the effect of their misuse becomes more and more impactful. The importance of automatic detection of threatening and abusive language can not be overestimated. However, most of the existing studies and state-of-the-art methods focus on English as the target language, with limited work on low- and medium-resource languages. In this paper, we present two shared tasks of abusive and threatening language detection for the Urdu language which has more than 170 million speakers worldwide. Both are posed as binary classification tasks where participating systems are required to classify tweets in Urdu into two classes, namely: (i) Abusive and Non-Abusive for the first task, and (ii) Threatening and Non-Threatening for the second. We present two manually annotated datasets containing tweets labelled as (i) Abusive and Non-Abusive, and (ii) Threatening and Non-Threatening. The abusive dataset contains 2400 annotated tweets in the train part and 1100 annotated tweets in the test part. The threatening dataset contains 6000 annotated tweets in the train part and 3950 annotated tweets in the test part. We also provide logistic regression and BERT-based baseline classifiers for both tasks. In this shared task, 21 teams from six countries registered for participation (India, Pakistan, China, Malaysia, United Arab Emirates, and Taiwan), 10 teams submitted their runs for Subtask A, which is Abusive Language Detection and 9 teams submitted their runs for Subtask B, which is Threatening Language detection, and seven teams submitted their technical reports. The best performing system achieved an F1-score value of 0.880 for Subtask A and 0.545 for Subtask B. For both subtasks, m-Bert based transformer model showed the best performance.

研究の動機と目的

  • 低リソース言語、特に1億7,000万人以上の話者がいるウルドゥー語におけるいじめおよび脅し行為検出に関する研究の不足に対処すること。
  • FIRE 2021およびODS SoC 2021の枠組み内で共有課題を実施することで、ウルドゥー語向けの強固なNLPシステムの開発を促進すること。
  • 今後の研究を支援するために、公開可能で高品質な手作業アノテート済みのウルドゥー語のいじめおよび脅し行為データセットを提供すること。
  • 伝統的な機械学習から最先端のトランスフォーマー・モデルまで、多様なNLPアプローチがウルドゥー語のテキスト分類タスクに与える影響を評価すること。
  • 国際的な協力を促進し、6か国から21のチームが、オンラインの安全に関連するウルドゥー語固有のNLP課題を解決することに参加すること。

提案手法

  • 2つの二値分類の共有課題を実施した:サブタスクAはいじめ対象の言語と非いじめ言語の分類、サブタスクBは脅しを含む内容と非脅し内容の分類。
  • データセットはTwitterデータを用いて構築され、アノテーションはTwitterの公式定義に従ったいじめおよび脅し行動の定義に従った。
  • 参加者には、正解ラベルが付与されたトレーニングセットと、評価用にラベルが非表示のテストセットが提供された。
  • ベースラインモデルとしてロジスティック回帰および多言語Bert(m-BERT)を実装し、比較のための追加ベースラインとしてXLM-RoBERTaを用いた。
  • 評価はF1スコアおよびROC-AUC指標を用い、主にプライベートテストセットにおけるF1スコアで順位付けされた。
  • 正解ラベルの公開後にデータ漏洩の可能性があるため、遅延提出は公式順位付けの対象外とされ、評価の公平性が保たれた。

実験結果

リサーチクエスチョン

  • RQ1m-BERTやXLM-RoBERTaといった多言語トランスフォーマー・モデルは、低リソースのウルドゥー語テキストにおけるいじめおよび脅し行為の検出にどの程度有効であるか?
  • RQ2伝統的な機械学習アプローチとディープラーニングベースの手法との間には、ウルドゥー語のいじめおよび脅し検出においてどの程度のパフォーマンス格差が存在するか?
  • RQ3特徴工学と事前学習された埋め込み表現は、エンドツーエンドの文脈的モデリングに比べて分類性能にどの程度寄与するか?
  • RQ4特にコードミックスや非公式な文脈において、言語的およびスタイル的パターンの違いに応じてシステムのパフォーマンスはどのように変化するか?
  • RQ5既存のデータセットには、実世界のいじめコンテンツ検出における一般化性およびロバスト性を支えるためにどのような課題や制限があるか?

主な発見

  • サブタスクA(いじめ言語検出)で優勝したシステムは、m-BERTモデルを用いてF1スコア0.880を達成し、伝統的な機械学習ベースラインを著しく上回った。
  • サブタスクB(脅し言語検出)では、公式結果としてm-BERTモデルがF1スコア0.545を達成したが、これはいじめ検出よりも検出が難しいことを示している。
  • 公式コンペティション終了後に提出されたチームSSNCSE_NLPの遅延提出では、サブタスクBでF1スコア0.805を記録しており、正解公開後のデータ漏洩の可能性を示唆している。
  • m-BERTモデルは両タスクにおいて一貫して他のアプローチを上回り、ウルドゥー語NLPタスクにおける強力な汎用性とロバスト性を示した。
  • SVM、ロジスティック回帰、ランダムフォレストといった伝統的モデルは、両タスクでF1スコアが0.60未満にとどまり、文脈表現の必要性を示している。
  • アノテート済みデータセット(トレーニングおよびテスト分割を含む)の公開により、今後の研究と再現性が可能となり、より大規模なデータおよびモデルのファインチューニングによってパフォーマンス向上の可能性が生まれた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。