Skip to main content
QUICK REVIEW

[論文レビュー] Abusive and Threatening Language Detection in Urdu using Supervised Machine Learning and Feature Combinations

Muhammad Humayoun|arXiv (Cornell University)|Apr 6, 2022
Hate Speech and Cyberbullying Detection被引用数 9
ひとこと要約

この論文では、ハイブリッド特徴工学とアンサンブルモデリングを用いた教師あり機械学習アプローチを提案し、ウルドゥー語ツイートにおけるいじめや脅しの言語を検出する。タスクA(いじめ言語検出)ではF1スコア0.8318、タスクB(脅し言語検出)ではF1スコア0.4931を達成した。SVMと最適化された特徴組み合わせ(例えば、トライグラムn-gramや事前学習済みウルドゥー語Word2Vec)が、ハイパーパramータチューニングとオーバーサンプリングによるデータバランス調整の後、最高のパフォーマンスを発揮した。

ABSTRACT

This paper presents the system descriptions submitted at the FIRE Shared Task 2021 on Urdu's Abusive and Threatening Language Detection Task. This challenge aims at automatically identifying abusive and threatening tweets written in Urdu. Our submitted results were selected for the third recognition at the competition. This paper reports a non-exhaustive list of experiments that allowed us to reach the submitted results. Moreover, after the result declaration of the competition, we managed to attain even better results than the submitted results. Our models achieved 0.8318 F1 score on Task A (Abusive Language Detection for Urdu Tweets) and 0.4931 F1 score on Task B (Threatening Language Detection for Urdu Tweets). Results show that Support Vector Machines with stopwords removed, lemmatization applied, and features vector created by the combinations of word n-grams for n=1,2,3 produced the best results for Task A. For Task B, Support Vector Machines with stopwords removed, lemmatization not applied, feature vector created from a pre-trained Urdu Word2Vec (on word unigrams and bigrams), and making the dataset balanced using oversampling technique produced the best results. The code is made available for reproducibility.

研究の動機と目的

  • ウルドゥー語SNSコンテンツにおけるいじめや脅しの言語を特定する強固なシステムの開発。
  • 低リソースNLP環境下におけるウルドゥー語のさまざまな特徴工学的手法の有効性の評価。
  • データバランス調整と言語的前処理を用いた教師あり機械学習による分類パフォーマンスの向上。
  • ウルドゥー語のいじめ言語検出のための再現可能でオープンソースのソリューションの貢献。
  • FIRE 2021で実施されたウルドゥー語のいじめおよび脅し言語検出共有タスクにおいて、競争力のある結果を達成すること。

提案手法

  • ウルドゥー語テキスト入力をクリーニングするため、ストップワード除去とレマルティゼーションを適用。
  • タスクAでは、ユニグラム、ビグラム、トライグラム(n-gram)の組み合わせを用いて特徴ベクトルを構築。
  • タスクBでは、ユニグラムおよびビグラムに事前学習済みウルドゥー語Word2Vec埋め込みを用いた。
  • 両タスクの主な分類器としてサポートベクターマシン(SVM)を採用。
  • タスクBの不均衡データセットをバランスさせるためにSMOTEオーバーサンプリングを適用。
  • ハイパーパramータの最適化を、反復的実験と交差検証を通じて実施。

実験結果

リサーチクエスチョン

  • RQ1ウルドゥー語のいじめ言語検出において、どの言語的前処理と特徴工学の組み合わせが最高のF1スコアをもたらすか?
  • RQ2低リソースのウルドゥー語NLP環境下で、データの不均衡は脅し言語検出モデルのパフォーマンスにどのように影響するか?
  • RQ3事前学習済みWord2Vec埋め込みは、ウルドゥー語の脅し言語検出における分類パフォーマンスの向上に寄与するか?
  • RQ4レマルティゼーションとストップワード除去は、ウルドゥー語のいじめ言語検出におけるモデルの汎化性能にどのような影響を与えるか?
  • RQ5さまざまなn-gramの組み合わせは、ウルドゥー語ツイートにおけるいじめ言語のパターンをどのように捉えているか?

主な発見

  • タスクAで最高のパフォーマンスを示したモデルは、SVMとn-gram特徴(n=1,2,3)、ストップワード除去、レマルティゼーションを組み合わせ、F1スコア0.8318を達成した。
  • タスクBでは、SVMと事前学習済みウルドゥー語Word2Vec埋め込み、レマルティゼーションなし、SMOTEによるデータオーバーサンプリングを組み合わせた結果、最高のF1スコア0.4931を達成した。
  • レマルティゼーションはタスクAでパフォーマンスを向上させたが、タスクBではその除去がわずかに有利であったため、タスク固有の言語的前処理のニーズがあることが示唆された。
  • トライグラムn-gramを用いた特徴工学は、ウルドゥー語ツイートにおけるいじめ言語の検出を顕著に向上させた。
  • タスクBでは、極めて不均衡なデータセットを有するため、オーバーサンプリングによるデータバランス調整がF1スコアの向上に不可欠であった。
  • 最終モデルは初期提出を上回るパフォーマンスを示し、コンペティション後でのハイパーパramータチューニングと実験の価値を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。