Skip to main content
QUICK REVIEW

[論文レビュー] Contextualizing Hate Speech Classifiers with Post-hoc Explanation

Brendan Kennedy, Xisen Jin|arXiv (Cornell University)|May 5, 2020
Hate Speech and Cyberbullying Detection参考文献 39被引用数 20
ひとこと要約

本稿では、サンプリングとオクルージョン(SOC)手法からの事後解釈を用いて、BERTベースの嫌がらせスパム分類器が『ゲイ』や『ブラック』などのグループ識別子に対してより文脈に敏感になるようにする、新しい正則化手法を提案する。この手法により、これらの語句への過剰な依存を軽減し、人間性を否定する言語などの文脈的手がかりへの注目を高めることで、ドメイン外データにおける誤検出を顕著に低減しながら、ドメイン内性能を維持または向上させることができる。

ABSTRACT

Hate speech classifiers trained on imbalanced datasets struggle to determine if group identifiers like "gay" or "black" are used in offensive or prejudiced ways. Such biases manifest in false positives when these identifiers are present, due to models' inability to learn the contexts which constitute a hateful usage of identifiers. We extract SOC post-hoc explanations from fine-tuned BERT classifiers to efficiently detect bias towards identity terms. Then, we propose a novel regularization technique based on these explanations that encourages models to learn from the context of group identifiers in addition to the identifiers themselves. Our approach improved over baselines in limiting false positives on out-of-domain data while maintaining or improving in-domain performance. Project page: https://inklab.usc.edu/contextualize-hate-speech/.

研究の動機と目的

  • 『ゲイ』や『ブラック』などのグループ識別子が攻撃的でない文脈に登場する場合に、嫌がらせ分類器が誤検出を生じる問題に対処すること。
  • 不均衡なデータセットにおける高頻度のアイデンティティ用語への過剰な依存を軽減することで、ドメイン外データにおけるモデルの一般化性能を向上させること。
  • データ拡張やモデルの再訓練を必要とせず、アイデンティティ用語の文脈的理解を向上させる正則化手法を開発すること。
  • 微調整済みBERTモデルに解釈に基づくフィードバックを統合し、より汎用的な嫌がらせ特徴への学習を促進すること。

提案手法

  • 微調整済みBERT分類器におけるグループ識別子の特徴重要度スコアを抽出するために、事後解釈アルゴリズムであるサンプリングとオクルージョン(SOC)を適用する。
  • SOC解釈を用いて、モデルが文脈的特徴(例:人間性を否定する言語)よりもアイデンティティ用語に偏って注目していることを同定する。
  • 訓練中にアイデンティティ用語に高い重要度が割り当てられるのを罰する、新しい正則化損失関数を提案する。これにより、モデルが周囲りの文脈に注目するよう促される。
  • 標準的な交差エントロピー損失と、SOC解釈スコアに基づく正則化項の組み合わせによる損失を用いてBERTモデルを訓練する。
  • 比較のため、訓練中にアイデンティティ用語を入力から除外する語の削除ベースラインをフィルタリングする。
  • ドメイン内嫌がらせ検出とドメイン外テストセット(例:NYTコーパス)におけるモデル性能を評価し、誤検出の低減を測定する。

実験結果

リサーチクエスチョン

  • RQ1SOCからの事後解釈は、嫌がらせ検出におけるモデルのアイデンティティ用語へのバイアスを効果的に明らかにできるか?
  • RQ2SOC解釈に基づく正則化により、アイデンティティ用語への注目を制御することで、ドメイン外データにおける誤検出が減少するか?
  • RQ3語の削除と比較して、解釈に基づく正則化は、ドメイン内嫌がらせ検出性能をどのように維持・向上させるか?
  • RQ4正則化によって、モデルの注目がアイデンティティ用語から、侮辱や人間性の否定といったより汎用的な嫌がらせの兆候へどれほどシフトするか?

主な発見

  • SOC解釈に基づく正則化により、ドメイン外のNYTコーパスにおける誤検出率が顕著に低下し、アイデンティティ用語への過剰な依存が減少した。
  • ドメイン内Gab Hate Corpusでは、ベースラインBERTモデルと比較して、F1スコアが維持または向上した。これは性能の低下がないことを示している。
  • 正則化後、SOC解釈のシフトを測定した結果、『責め立てられた』『毒された』『人間性を否定する』といった文脈的嫌がらせの兆候への注目が増加した。
  • 語の削除と比較して、SOCベースの正則化はより高い再現率を達成しており、実際に嫌がらせを検出する能力を損なわずにバイアスを軽減していることが示された。
  • 可視化により、正則化が誤検出を是正し、モデルのアイデンティティ用語への注目を低下させるとともに、文脈的特徴への感受性を高めていることが確認された。
  • 本手法は、データ拡張やBERTのアーキテクチャの変更なしに、モデルの文脈感受性を効果的に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。