Skip to main content
QUICK REVIEW

[論文レビュー] Hostility Detection Dataset in Hindi

Mohit Bhardwaj, Md Shad Akhtar|arXiv (Cornell University)|Nov 6, 2020
Hate Speech and Cyberbullying Detection参考文献 9被引用数 16
ひとこと要約

本稿では、約8,200件のソーシャルメディア投稿を含む、手動でアノテートされた新しいヒンディー語の敵対的行動検出データセットを紹介する。このデータセットは、フェイクニュース、ヘイトスピーチ、攻撃的言語、中傷の4つの敵対的次元に加え、非敵対的クラスのラベルを含む。クラス間に重複があるため、マルチラベルタギングをサポートしており、CONSTRAINT-2021共有タスクの一部として公開されている。m-BERT埋め込みを用いたベースラインモデルは、粗い分類におけるF1スコアが84.11%(SVM)に達し、パンデミックのような危機的文脈における低リソース言語NLPにおける有用性を示している。

ABSTRACT

In this paper, we present a novel hostility detection dataset in Hindi language. We collect and manually annotate ~8200 online posts. The annotated dataset covers four hostility dimensions: fake news, hate speech, offensive, and defamation posts, along with a non-hostile label. The hostile posts are also considered for multi-label tags due to a significant overlap among the hostile classes. We release this dataset as part of the CONSTRAINT-2021 shared task on hostile post detection.

研究の動機と目的

  • ヒンディー語のような低リソースインド言語における大規模かつ多次元の敵対的行動検出データセットの不足に対処すること。
  • フェイクニュース、ヘイトスピーチ、攻撃的言語、中傷の4つの敵対的次元をカバーする約8,200件のヒンディー語ソーシャルメディア投稿を収集・手動アノテートすること。
  • 敵対的コンテンツの粗い分類(敵対的 vs. 非敵対的)および細かい分類(マルチラベル)の両方を支援すること。
  • CONSTRAINT-2021共有タスクの一部としてデータセットを公開し、低リソース・緊急時文脈における敵対的行動検出分野の研究を促進すること。
  • ヒンディー語NLPにおける下流タスクのベンチマーク化を図るため、m-BERT埋め込みを用いたベースラインモデルを提供すること。

提案手法

  • データセットは、フォーラム、チャットルーム、ゲームコミュニティを含む多様なソーシャルメディアプラットフォームから約8,200件のオンラインヒンディー語投稿を収集することで構築された。
  • 各投稿は、最大4つの敵対的ラベル(フェイク、ヘイト、攻撃的、中傷)と非敵対的ラベルを手動でアノテートされ、意味的重複を考慮してマルチラベル分類が可能である。
  • 前処理には、標準的なヒンディー語ストップワードリストを用いてURL、絵文字、アルファベット・数字以外の文字(句点を除く)およびストップワードの削除が行われた。
  • 文の埋め込みは、マルチリンガルBERT(m-BERT)モデルを用いて抽出され、最後の層のトークン表現を平均化して文レベルの埋め込みが生成された。
  • 粗い分類および細かい分類の両方のタスクに対して、SVM、ロジスティック回帰、ランダムフォレスト、MLPの4つの従来の機械学習モデルが、埋め込みデータ上で訓練された。
  • データの不均衡を緩和するため、SVMおよびロジスティック回帰ではクラスウェイトをバランスさせた。特に、1クラスあたり約800件のトレーニングサンプルを有する細かい分類タスクで有効であった。

実験結果

リサーチクエスチョン

  • RQ1標準的な機械学習モデルは、低リソースヒンディー語テキストにおける敵対的行動の複数の次元をどれほど効果的に検出できるか?
  • RQ2ヒンディー語における敵対的カテゴリ(例:ヘイト、攻撃的、中傷)の重複度はどの程度で、アノテーションではどのようにモデル化すべきか?
  • RQ3m-BERTベースの文の埋め込みは、ヒンディー語ソーシャルメディアコンテンツにおける敵対的行動検出の意味的手がかりを効果的に捉えられるか?
  • RQ4特に少数派クラスにおいて、粗い分類と細かい分類の間で性能差はどの程度生じるか?
  • RQ5データの不均衡は、細かい分類タスクにおけるモデル性能にどのように影響し、どのような緩和戦略が有効か?

主な発見

  • データセットには、敵対的投稿が合計4,358件(少なくとも1つのラベルが付与されたものが3,834件)と、非敵対的投稿が4,358件あり、4つの敵対的次元にわたってバランスの取れた分布を示している。
  • SVMが粗い分類で最高のF1スコア84.11%を達成し、ロジスティック回帰(83.98%)、MLP(83.45%)、ランダムフォレスト(79.79%)を上回った。
  • 細かい分類においても、SVMはヘイト(47.49%)、攻撃的(41.98%)、中傷(43.57%)の各クラスで最高のF1スコアを記録した。
  • フェイクニュース検出ではロジスティック回帰が最も優れた性能を示し、F1スコア68.15%を達成し、他のモデルを大きく上回った。
  • 混同行列の分析から、モデルは特に中傷およびフェイクニュースクラスで困難を示しており、曖昧さやクラスの不均衡が原因であると示唆された。
  • データセットのマルチラベル機能により、重複する敵対的次元が捉えられており、敵対的投稿の26.7%が複数のカテゴリにラベル付けされている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。