Skip to main content
QUICK REVIEW

[論文レビュー] Hypothesis Engineering for Zero-Shot Hate Speech Detection

Janis Goldzycher, Gerold A. Schneider|arXiv (Cornell University)|Oct 3, 2022
Hate Speech and Cyberbullying Detection被引用数 7
ひとこと要約

本論文は、複数のNLIベースの仮説を組み合わせることで、ゼロショットハートスピーチ検出の性能を向上させる仮説設計手法を提案する。カウンタースピーチ、再利用された差別的スラング、および暗黙の嫌がらせといった主な失敗モードに対処する。強力なNLIベースラインに対して、HateCheckでは7.9パーセンテージポイント、ETHOSでは10.0パーセンテージポイントの精度向上を達成し、微調整を一切行わずに、誤り駆動型の仮説設計がモジュラーかつ解釈可能である手法でゼロショット性能を顕著に向上させることを示している。

ABSTRACT

Standard approaches to hate speech detection rely on sufficient available hate speech annotations. Extending previous work that repurposes natural language inference (NLI) models for zero-shot text classification, we propose a simple approach that combines multiple hypotheses to improve English NLI-based zero-shot hate speech detection. We first conduct an error analysis for vanilla NLI-based zero-shot hate speech detection and then develop four strategies based on this analysis. The strategies use multiple hypotheses to predict various aspects of an input text and combine these predictions into a final verdict. We find that the zero-shot baseline used for the initial error analysis already outperforms commercial systems and fine-tuned BERT-based hate speech detection models on HateCheck. The combination of the proposed strategies further increases the zero-shot accuracy of 79.4% on HateCheck by 7.9 percentage points (pp), and the accuracy of 69.6% on ETHOS by 10.0pp.

研究の動機と目的

  • 微調整やラベル付きデータを一切使用せずに、ゼロショットハートスピーチ検出の精度を向上させること。
  • 通常のNLIベースのゼロショットハートスピーチ検出における特定の失敗モードを同定し、それらに対処すること。
  • 特定の仮説設計に焦点を当てた、モジュラーで解釈可能なNLIベースのゼロショット分類を強化するフレームワークを構築すること。
  • HateCheck や ETHOS のような未学習データセットにおける仮説の組み合わせの有効性を評価すること。
  • 低リソースまたは新興言語環境においても適用可能な、データ効率的でスケーラブルなハートスピーチ検出を可能にすること。

提案手法

  • HateCheckベンチマークを用いて、通常のNLIベースのゼロショットハートスピーチ検出システムの誤り分析を実施する。
  • 4つの仮説ベースの戦略を設計:ターゲットグループによるフィルタリング、カウンタースピーチのフィルタリング、再利用スラングのフィルタリング、および人間性を否定する比喩の検出。
  • 各戦略に対して複数の仮説を用い、ハートスピーチ検出に関連する特定の文語的現象を予測する。
  • ルールベースまたは信頼度重み付き集約を用いて、複数の仮説からの予測を統合し、最終的な判断を導出する。
  • 入力テキストに対して、特定のハートスピーチ的特徴をテストする仮説を生成することで、戦略を適用する。
  • 開発用にHateCheck、未学習テストセットとしてETHOSを用いて、システム全体の性能向上を測定する。

実験結果

リサーチクエスチョン

  • RQ1通常のNLIベースのゼロショットハートスピーチ検出における主な失敗モードは何か?
  • RQ2単一の仮説定式化を超えて、複数の仮説を組み合わせることで、ゼロショットハートスピーチ検出の性能を向上させられるか?
  • RQ3カウンタースピーチや再利用スラングといった特定の誤りタイプを緩和するための、的を射た仮説戦略はどの程度有効か?
  • RQ4提案された戦略は、ETHOSのような未学習データセットに対しても一般化可能か?
  • RQ5ラベル付きデータを一切必要とせず、仮説設計によって、微調整済みモデルと同等の性能向上を達成できるか?

主な発見

  • 通常のNLIベースのゼロショットベースラインは、HateCheckベンチマークにおいて、商用システムおよび微調整済みBERTモデルを上回る性能を示した。
  • 提案された4つの仮説戦略をすべて組み合わせることで、HateCheckにおけるゼロショット精度が7.9パーセンテージポイント向上し、79.4%に達した。
  • ETHOSデータセットでは、戦略の組み合わせにより精度が10.0パーセンテージポイント向上し、69.6%に達した。
  • 性能向上の主な要因は、カウンタースピーチや暗黙の嫌がらせといった、従来の問題点であったケースの検出精度向上に起因する。
  • 人間性を否定する比喩を検出する戦略は、ETHOSにおいてわずかな負の影響を示したため、文脈依存的な有効性があると考えられる。
  • モジュラー設計により、戦略の追加・削除や信頼度しきい値の調整によって、精度-再現率のトレードオフを容易に調整可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。