[論文レビュー] An Information Retrieval Approach to Building Datasets for Hate Speech Detection
本稿では、キーワードマッチィングの制限を超えて、希少で多様な嫌がらせ表現を効率的に特定・アノテーションするため、プーリングとアクティブラーニングを活用した情報検索(IR)にインspiredしたアプローチを提案する。主な貢献は、より広範かつ現実的な分布を反映する新しいベンチマークデータセットの構築であり、このデータセットでテストした既存モデルの性能が顕著に低下することが明らかになった。
Building a benchmark dataset for hate speech detection presents various challenges. Firstly, because hate speech is relatively rare, random sampling of tweets to annotate is very inefficient in finding hate speech. To address this, prior datasets often include only tweets matching known "hate words". However, restricting data to a pre-defined vocabulary may exclude portions of the real-world phenomenon we seek to model. A second challenge is that definitions of hate speech tend to be highly varying and subjective. Annotators having diverse prior notions of hate speech may not only disagree with one another but also struggle to conform to specified labeling guidelines. Our key insight is that the rarity and subjectivity of hate speech are akin to that of relevance in information retrieval (IR). This connection suggests that well-established methodologies for creating IR test collections can be usefully applied to create better benchmark datasets for hate speech. To intelligently and efficiently select which tweets to annotate, we apply standard IR techniques of {\\em pooling} and {\\em active learning}. To improve both consistency and value of annotations, we apply {\\em task decomposition} and {\\em annotator rationale} techniques. We share a new benchmark dataset for hate speech detection on Twitter that provides broader coverage of hate than prior datasets. We also show a dramatic drop in accuracy of existing detection models when tested on these broader forms of hate. Annotator rationales we collect not only justify labeling decisions but also enable future work opportunities for dual-supervision and/or explanation generation in modeling. Further details of our approach can be found in the supplementary materials.
研究の動機と目的
- 事前に定義された「嫌がらせ語」に依存する既存の嫌がらせ検出データセットの限界を是正し、サンプリングバイアスやカバレッジの狭さを解消すること。
- ランダムサンプリングの非効率性を克服し、IR技術を活用して嫌がらせである可能性の高いツイートを優先的に特定すること。
- タスク分解と根拠収集により、アノテーションの一貫性と解釈可能性を向上させること。
- キーワードフィルタで捉えきれない表現を含む、現実世界の嫌がらせの真の多様性と複雑性を反映するベンチマークデータセットの作成。
- 最先端の嫌がらせ検出モデルが、より広範かつ現実的なこのデータセットでは著しく性能を落とすことを示し、より良い学習データの必要性を強調すること。
提案手法
- 複数の多様な嫌がらせ検出モデルから上位ランクのツイートをプーリングすることで、希少で複雑な嫌がらせ表現のカバレッジを拡大するIR技術の応用。
- 1つのモデルを用いたアクティブラーニングにより、反復的に情報量の多いツイートを選別してアノテーションを実施し、アノテーション予算を最適化するとともに、モデルの汎化性能を向上。
- ラベル付けタスクをサブタスク(例:嫌がらせの同定、標的グループの同定)に分解することで、アノテーターの一貫性を向上。
- ラベル付け意思決定の根拠(理由)を収集することで、将来の説明生成やデュアルスーパvisedラーニングの分野における新たな道筋を開く。
- コーパス構築段階と最終アノテーションサンプリング段階の両方でランダムサンプリングを統合し、選択バイアスを低減。
- プーリングの初期モデルを学習するために、事前に存在する嫌がらせ検出データセットを活用するが、それらに内在するバイアスが伝搬されるリスクを認識している。
実験結果
リサーチクエスチョン
- RQ1プーリングやアクティブラーニングといったIR技術が、嫌がらせ検出データセット作成の効率性とカバレッジ向上に効果的に応用可能かどうか。
- RQ2キーワードベースでない嫌がらせ表現の組み込みが、既存の嫌がらせ検出モデルの性能にどのように影響するか。
- RQ3アノテーターの根拠とタスク分解が、ラベル付けの一貫性とモデルの解釈可能性をどの程度向上させるか。
- RQ4提案されたデータセットにおける嫌がらせの分布が、従来のベンチマークデータセットと比較して多様性と現実性の観点でどのように異なるか。
- RQ5データセットバイアス(例:トピック的、人口統計的)が、学習済み嫌がらせ検出モデルの汎化性能と公平性に与える影響は何か。
主な発見
- 提案されたデータセットは、従来のデータセットと比較して、キーワードマッチィングのみで検出可能な表現を超える、はるかに広範な嫌がらせ表現を捉えている。
- 既存の嫌がらせ検出モデルは、新しいデータセットで評価された際、正確性が著しく低下しており、従来のモデルが狭いキーワードベースの分布に過剰適合していることが示唆された。
- 多様なモデルからのプーリングにより、希少で複雑な嫌がらせ表現を捉える可能性が高まり、真の陽性を逃すリスクが低減された。
- プロセス中に収集されたアノテーターの根拠は、ラベル付け意思決定の正当化に価値をもたらし、説明に配慮したモデリングの新たな道筋を開いた。
- バイアス低減に努めたものの、プーリングに使用した初期モデルやその背後にある学習データから、トピック的および人口統計的表現においてバイアスが引き継がれる可能性は依然として存在する。
- 本研究は、嫌がらせ検出においてデータセット設計がモデル設計と同等に重要であることを示しており、不適切なデータは実世界の展開におけるモデル性能と公平性を著しく制限することがある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。