Skip to main content
QUICK REVIEW

[論文レビュー] Emojis as Anchors to Detect Arabic Offensive Language and Hate Speech

Hamdy Mubarak, Sabit Hassan|arXiv (Cornell University)|Jan 18, 2022
Hate Speech and Cyberbullying Detection被引用数 6
ひとこと要約

本稿では、絵文字をアンカーツールとして用いることで、言語に依存しない方法でアラビア語の攻撃的言語および憎悪スピーチを収集する手法を提案する。これにより、攻撃的ツイートが35%、憎悪スピーチが11%に達し、従来の手法よりも顕著に高い水準に達する。本手法により、細分化されたアノテーションを備えた、最大規模の公開可能なアラビア語データセットが得られ、外部ベンチマークで最先端の性能を示し、絵文字依存のパターンを超えた一般化能力を示している。

ABSTRACT

We introduce a generic, language-independent method to collect a large percentage of offensive and hate tweets regardless of their topics or genres. We harness the extralinguistic information embedded in the emojis to collect a large number of offensive tweets. We apply the proposed method on Arabic tweets and compare it with English tweets - analysing key cultural differences. We observed a constant usage of these emojis to represent offensiveness throughout different timespans on Twitter. We manually annotate and publicly release the largest Arabic dataset for offensive, fine-grained hate speech, vulgar and violence content. Furthermore, we benchmark the dataset for detecting offensiveness and hate speech using different transformer architectures and perform in-depth linguistic analysis. We evaluate our models on external datasets - a Twitter dataset collected using a completely different method, and a multi-platform dataset containing comments from Twitter, YouTube and Facebook, for assessing generalization capability. Competitive results on these datasets suggest that the data collected using our method captures universal characteristics of offensive language. Our findings also highlight the common words used in offensive communications, common targets for hate speech, specific patterns in violence tweets; and pinpoint common classification errors that can be attributed to limitations of NLP models. We observe that even state-of-the-art transformer models may fail to take into account culture, background and context or understand nuances present in real-world data such as sarcasm.

研究の動機と目的

  • アラビア語の攻撃的言語および憎悪スピーチ検出のための、大規模でバランスの取れた手動アノテーション付きデータセットの不足を是正すること。
  • 言語的キーワードやパターンに依存せずに、言語およびトピックに依存しない方法で攻撃的ツイートを収集する手法の開発。
  • 攻撃的言語、憎悪スピーチ、下品語、暴力的コンテンツの4つの側面について、細分化されたアノテーションが施された、最大規模の公開可能なアラビア語データセットの作成。
  • 本データセットで訓練されたモデルの、多様な外部データセット(多言語およびマルチプラットフォーム)への一般化能力の評価。
  • 攻撃的コンテンツにおける皮肉、文脈、方言的変異の検出における、言語的パターン、文化的ニュアンス、およびモデルの限界の解明。

提案手法

  • 言語に依存しない外的要因としての絵文字を活用し、言語固有のキーワード依存を回避しながら、攻撃的コンテンツの確率が高めのツイートを収集する。
  • 公開済みのデータセットから頻出する絵文字を抽出することで、非言語的で汎用的なシードベースのアプローチを採用し、データ収集を開始する。
  • 190名を超えるアノテータが関与する複数段階のアノテーションパイプラインを適用し、攻撃的性、憎悪スピーチ、下品語、暴力的コンテンツの各項目についてアノテート。品質管理にはテスト問題を導入。
  • 収集したデータセット上で、複数のトランスフォーマーモデルアーキテクチャ(例:QARiB)を微調整し、攻撃的言語および憎悪スピーチ分類を実行。
  • 訓練およびテストデータセットから絵文字を削除した状態でモデルの一般化能力を評価し、OffensEval 2020 や MPOLD といった外部データセットを用いて検証。
  • データセットに対して、言語的および時間的分析を実施し、攻撃的言語のパターン、憎悪スピーチの標的、下品語の形態的変異を特定。

実験結果

リサーチクエスチョン

  • RQ1絵文字は、アラビア語の文脈において、信頼性があり、言語に依存しないアンカーとして、攻撃的および憎悪スピーチのツイートを高割合で収集可能だろうか?
  • RQ2アラビア語のツイッターにおいて、攻撃的コンテンツの分布は、時間的要因、方言、社会的標的の観点からどのように変動するか?
  • RQ3絵文字に依存するデータで訓練されたモデルは、絵文字を含まない外部データセットに対しても、どの程度一般化できるか?
  • RQ4アラビア語のソーシャルメディアにおける攻撃的・暴力的・下品なコンテンツの特徴となる言語的パターンは何か、特に標準でない綴りや方言形態を含めて。
  • RQ5最先端のNLPモデルは、攻撃的言語における皮肉、文脈、文化的ニュアンスを検出する際に、どのような恒常的な失敗モードを示すか?

主な発見

  • 絵文字をアンカーとする手法により、攻撃的ツイートが35%、憎悪スピーチが11%に達し、従来のキーワードベース手法と比べてほぼ2倍の効果を示した。
  • 本研究で提示されたデータセットは、攻撃的言語の多段階的アノテーション(細分化された憎悪スピーチ、下品語、暴力的コンテンツ含む)が施された、公開可能な最大規模のアラビア語データセットである。
  • 本データセットで微調整されたモデルは、SemEval 2020 アラビア語攻撃的言語検出ベンチマークでF1スコア85.03を達成し、優れた性能を示した。
  • 訓練およびテストデータセットから絵文字を削除した状態でも、モデルは高い性能(テストセットでF1 = 83.05)を維持した。これは、絵文字依存を越えた一般化能力を示している。
  • MPOLDデータセット(ツイッター、ユーチューブ、フェイスブックのコメントを含む)においても、既存の手法を上回る性能を示し、クロスプラットフォームでの一般化能力を確認した。
  • 分析の結果、憎悪スピーチの一般的な標的、下品語における繰り返しの形態的パターン、暴力的ツイートにおける特徴的な言語的構造が特定された一方で、皮肉や文化的文脈の検出におけるモデルの失敗が明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。