Skip to main content
QUICK REVIEW

[論文レビュー] Author Profiling for Hate Speech Detection

Pushkar Mishra, Marco Del Tredici|arXiv (Cornell University)|Feb 14, 2019
Hate Speech and Cyberbullying Detection参考文献 31被引用数 12
ひとこと要約

本稿では、ソーシャルネットワーク埋め込みから得られるコミュニティベースの著者プロファイリング特徴を、既存のディープラーニングモデルに統合する、新しいヘイトスピーチ検出アプローチを提案する。node2vecを用いてコミュニティ構造を捉える低次元の著者埋め込みを生成することで、人種差別および性別差別のラベルが付与された16kツイートのデータセットにおいて、最先端のベースラインを著しく上回る性能を発揮した。これは、言語的・意味的特徴に加えて、ソーシャルネットワークの文脈が検出性能を向上させることを示している。

ABSTRACT

The rapid growth of social media in recent years has fed into some highly undesirable phenomena such as proliferation of abusive and offensive language on the Internet. Previous research suggests that such hateful content tends to come from users who share a set of common stereotypes and form communities around them. The current state-of-the-art approaches to hate speech detection are oblivious to user and community information and rely entirely on textual (i.e., lexical and semantic) cues. In this paper, we propose a novel approach to this problem that incorporates community-based profiling features of Twitter users. Experimenting with a dataset of 16k tweets, we show that our methods significantly outperform the current state of the art in hate speech detection. Further, we conduct a qualitative analysis of model characteristics. We release our code, pre-trained models and all the resources used in the public domain.

研究の動機と目的

  • コミュニティベースの著者プロファイリングが、従来のテキスト特徴に加えてヘイトスピーチ検出を改善するかを調査すること。
  • ヒモロジーおよびオンラインコミュニティが、憎悪的言語のパターンをどのように形成するかを探索すること。
  • ユーザーのネットワーク構造とディープラーニングを組み合わせた、性能向上を図る手法を開発・評価すること。
  • 再現可能性および今後の研究を支援するため、コード、事前学習済みモデル、データセットを公開すること。

提案手法

  • 16kツイートのデータセットにおけるリツイートおよびメンションに基づき、Twitterの著者間の有向グラフを構築した。
  • node2vecを用いて、コミュニティ参加状況および社会的構造を捉える低次元の密な著者埋め込みを学習した。
  • 著者埋め込みを、ロジスティック回帰やRNNベースのモデルを含むベースラインのヘイトスピーチ分類器に追加特徴として統合した。
  • 人種差別および性別差別のラベルが付与されたデータに対して、5分割交差検証の設定でモデルを学習・評価した。
  • 著者埋め込みの可視化のためt-SNEを用い、クラスタが類似した言語的行動を示すコミュニティに対応していることを検証した。
  • 誤分類を回避するため、URLのブラックリストを維持した。

実験結果

リサーチクエスチョン

  • RQ1特定のオンラインコミュニティに属する著者は、ヘイトスピーチを生成しやすいか?
  • RQ2コミュニティベースの著者プロファイリング特徴は、ヘイトスピーチ検出システムの性能を向上させられるか?
  • RQ3ソーシャルネットワークから得た著者埋め込みは、純粋な語彙的または意味的特徴に比べて、ヘイトスピーチ検出においてどのように優れているか?
  • RQ4プロファイリング特徴を追加しても、依然として誤分類されるタイプの憎悪的コンテンツはどのようなものか?

主な発見

  • node2vecによる著者埋め込みの追加により、テキスト特徴のみを用いた最先端のベースラインを著しく上回るヘイトスピーチ検出性能が達成された。
  • 人種差別および性別差別のラベルが付与された16kツイートのデータセットにおいて、本モデルは最先端の結果を達成し、分類に際してソーシャルネットワーク構造の価値を示した。
  • 著者埋め込みの可視化により、ヘイトスピーチを頻繁に投稿するユーザーのコミュニティに対応する濃密なクラスタが明確に観察された。特に、性別差別クラスにおいて顕著であった。
  • 性能向上にもかかわらず、表記を隠蔽した語(例:'c*nt')や、憎悪的コンテンツを指す短縮URLを含むツイートは依然として誤分類され、現在の検出戦略の限界を示した。
  • 本研究により、ヘイトスピーチを発する傾向があるユーザーは、一貫したオンラインコミュニティを形成する傾向があることが確認され、オンラインディス courseにおけるヒモロジーの関連性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。