Skip to main content
QUICK REVIEW

[論文レビュー] A Benchmark Dataset for Learning to Intervene in Online Hate Speech

Jing Qian, Anna Bethke|arXiv (Cornell University)|Sep 10, 2019
Hate Speech and Cyberbullying Detection参考文献 32被引用数 7
ひとこと要約

本論文は、会話的文脈と人間が書いた対応応答を含む、RedditとGabから得た大規模で完全にラベル付けされた2つのデータセットを提示する、生成的ヘイトスピーチ対処という新しいタスクを導入する。主な貢献は、文脈に配慮した効果的な対応応答を生成するモデルのトレーニングと評価のためのベンチマークを提供することであり、その結果、自動手法は人間が書いた対応応答と比較して大幅に改善の余地があることが示された。

ABSTRACT

Countering online hate speech is a critical yet challenging task, but one which can be aided by the use of Natural Language Processing (NLP) techniques. Previous research has primarily focused on the development of NLP methods to automatically and effectively detect online hate speech while disregarding further action needed to calm and discourage individuals from using hate speech in the future. In addition, most existing hate speech datasets treat each post as an isolated instance, ignoring the conversational context. In this paper, we propose a novel task of generative hate speech intervention, where the goal is to automatically generate responses to intervene during online conversations that contain hate speech. As a part of this work, we introduce two fully-labeled large-scale hate speech intervention datasets collected from Gab and Reddit. These datasets provide conversation segments, hate speech labels, as well as intervention responses written by Mechanical Turk Workers. In this paper, we also analyze the datasets to understand the common intervention strategies and explore the performance of common automatic response generation methods on these new datasets to provide a benchmark for future research.

研究の動機と目的

  • 既存のヘイトスピーチ検出手法の限界を克服するため、検出を越えて、応答生成を通じてヘイトスピーチを能動的に是正する生成的対処タスクを提案すること。
  • 会話的文脈を保持し、人間が書いた対処応答を含む、RedditとGabから得た大規模で完全にラベル付けされた2つのデータセットを構築すること。
  • オンラインのヘイトスピーチ対処の文脈において、自動応答生成モデルの評価のためのベンチマークを提供すること。
  • 人間が用いる一般的な対処戦略を分析し、最先端の生成的モデルがこれらのデータセット上でどのように性能を発揮するかを評価すること。

提案手法

  • データセットはRedditとGabから収集され、会話の断片がMechanical Turkの作業者を用いてヘイトスピーチのラベル付けが行われた。
  • 各会話には、ヘイトスピーチを含む投稿、それ以前の文脈、および人間が書いた対処応答が含まれており、文脈への配慮が保証されている。
  • 本研究では、Seq2Seq、VAE、強化学習(RL)でファインチューニングされたモデルの複数の生成モデルを評価した。
  • 自動評価指標にはBLEU、ROUGE、METEORが用いられ、人間による評価では応答の有効性と多様性が評価された。
  • モデルは両方のデータセットでトレーニングおよびテストされ、文脈の関連性を向上させるために入力フィルタリングが適用された。
  • 本研究では、自動指標と人間のアノテーションの両方を用いてモデルの性能を比較し、現実世界での有効性を評価した。

実験結果

リサーチクエスチョン

  • RQ1オンラインのヘイトスピーチに対して人間が用いる最も一般的な対処戦略は何か?
  • RQ2自動応答生成モデルは、文脈に配慮したヘイトスピーチ対処において、人間が書いた応答と比べてどの程度の性能を示すか?
  • RQ3BLEU、ROUGE、METEORといった自動評価指標は、人間による応答品質の判断とどの程度相関しているか?
  • RQ4VAEのようなモデルが、自動スコアが高いうえで、なぜ応答の多様性が低くなるのか?
  • RQ5データセットのサイズや分布(例:Gab対Reddit)は、モデルの汎化性能や性能にどの程度影響を与えるか?

主な発見

  • VAEモデルは人間評価において著しく低い多様性を示し、特定のヘイトキーワード(例:障害者を標的にするもの)に関連する一般的なフレーズを繰り返す傾向があった。
  • 高水準の自動スコア(例:BLEU 4.2、ROUGE 20.4、METEOR 18.2)を達成したが、文脈に乏しい普遍的な応答「差し出しがたい言葉を用いないでください」は、文脈の欠如により品質が低いと判断された。
  • 強化学習(RL)でファインチューニングされたモデルは、人間のアノテーターによってより有効で多様な応答を生成し、特にGabデータセットでは顕著な結果を示したが、自動指標では他のモデルに劣っていた。
  • 入力の会話文脈をフィルタリングしたSeq2Seqモデルは、自動スコアが高くなったことから、文脈のフィルタリングが性能向上に寄与することが示された。
  • 両方のデータセットにおいて、70%以上で人間が書いた応答が機械生成されたものよりも好まれ、品質と文脈への適合性のギャップが顕著に示された。
  • 平均投稿長が長いためノイズが多く、より小さいRedditデータセットは、特に訓練データが限られた場合にモデルにとってより困難であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。