Skip to main content
QUICK REVIEW

[論文レビュー] Why Is It Hate Speech? Masked Rationale Prediction for Explainable Hate Speech Detection

Jiyun Kim, Byounghan Lee|arXiv (Cornell University)|Nov 1, 2022
Hate Speech and Cyberbullying Detection被引用数 11
ひとこと要約

本稿では、文脈に依存する根拠スニペット(人間がアノテートした根拠)を周囲いのトークンと露出させた根拠埋め込みに基づいて、マスクされた人間アノテート根拠を予測させるようにBERTを微調整する二段階微調整手法であるマスクドリーダソン予測(MRP)を提案する。この手法は、HateXplainベンチマークにおいて、バイアス低減、説明可能性、検出精度の面で最先端の性能を達成し、特に明示的な嫌がらせ表現がない暗黙の嫌がらせを識別する点で優れた性能を示す。

ABSTRACT

In a hate speech detection model, we should consider two critical aspects in addition to detection performance-bias and explainability. Hate speech cannot be identified based solely on the presence of specific words: the model should be able to reason like humans and be explainable. To improve the performance concerning the two aspects, we propose Masked Rationale Prediction (MRP) as an intermediate task. MRP is a task to predict the masked human rationales-snippets of a sentence that are grounds for human judgment-by referring to surrounding tokens combined with their unmasked rationales. As the model learns its reasoning ability based on rationales by MRP, it performs hate speech detection robustly in terms of bias and explainability. The proposed method generally achieves state-of-the-art performance in various metrics, demonstrating its effectiveness for hate speech detection.

研究の動機と目的

  • 特定の嫌がらせ語に依存するが、文脈的推論に基づかない傾向がある嫌がらせ検出モデルにおけるバイアスと説明可能性の問題に対処すること。
  • 明示的な嫌がらせスラングがないが、文脈によって嫌がらせの意味が生じる暗黙の嫌がらせを検出するためのモデルの頑健性を向上させること。
  • 文脈的手がかりに基づいてマスクされた根拠セグメントを予測することで、モデルが人間のような推論を学習できる訓練フレームワークを開発すること。
  • モデルが生成する根拠を人間がアノテートした根拠スニペットにできるだけ近づけることで、モデルの説明可能性を向上させること。
  • HateXplainベンチマークにおいて、性能指標、バイアス指標、説明可能性指標のすべてで最先端の性能を達成すること。

提案手法

  • 人間がアノテートした根拠をトークンレベルの根拠埋め込みに変換し、訓練中にBERTの入力埋め込みに組み込む。
  • 一部の根拠埋め込みをゼロベクトルに置き換えることで、モデルがマスクされた根拠トークンを予測するようにする、マスクドリーダソン予測タスクを実装する。
  • BERTを二段階で訓練する:まずMRPで文脈に依存する推論を学習し、その後、更新されたパラメータを用いて嫌がらせ検出タスクで微調整する。
  • LIMEを介してモデルの注意重みを用いて説明可能性を評価し、予測された根拠を人間がアノテートした真値と比較する。
  • MRP訓練中にマスキング率(例:50%)を適用し、学習能力と一般化性能のバランスを保ち、下流の検出性能を最適化する。
  • HateXplainベンチマークの人工アノテート根拠と嫌がらせラベルを活用し、文脈に根ざした方法でモデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1マスクされた人間の根拠を予測するように訓練されたモデルは、嫌がらせ検出においてより文脈に根ざした、人間らしい推論を学習できるか?
  • RQ2MRPで訓練することで、嫌がらせ語に依存する予測に対するバイアスの低減と、検出性能の両方が向上するか?
  • RQ3直接的な根拠監視やマスクド言語モデルと比較して、MRPは説明可能性とバイアス低減の面で優れているか?
  • RQ4MRPは、明示的なスラングで示されないが、文脈によって嫌がらせの意味が生じる暗黙の嫌がらせの検出を向上させられるか?
  • RQ5MRP訓練において、下流の嫌がらせ検出性能を最適化するのに適したマスキング率は何か?

主な発見

  • BERT-MRPはHateXplainベンチマークの全11項目の指標(性能指標、バイアス指標、説明可能性指標)で最先端の性能を達成した。
  • MRPにおける50%のマスキング率が、最良の下流の嫌がらせ検出性能をもたらし、監視と一般化の最適なバランスを示した。
  • BERT-MRPは、BERT-RPおよびBERT-HateXplainを上回り、特に暗黙の嫌がらせの事例において人間がアノテートした真値との根拠の整合性が高かった。
  • モデルが生成する根拠予測は、根拠が文に散らばっている場合に一様な注意を示すBERT-HateXplainよりも、人間がアノテートした根拠とより一貫していた。
  • 文脈に依存する推論メカニズムのおかげで、特定の嫌がらせ語が存在しない暗黙の嫌がらせの検出において、BERT-MRPは優れた頑健性を示した。
  • 特定の嫌がらせ語への過剰な依存を低減することで、バイアス指標の向上が確認されたことから、この手法は効果的にバイアスを低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。