Skip to main content
QUICK REVIEW

[論文レビュー] Intersectional Bias in Hate Speech and Abusive Language Datasets

Jae‐Yeon Kim, Carlos Ortiz|arXiv (Cornell University)|May 12, 2020
Hate Speech and Cyberbullying Detection参考文献 24被引用数 16
ひとこと要約

本研究は、公開されたTwitterデータセットからの99,996件のツイートを対象に、人種、性別、政治的帰属の観点から、嫌がらせ発言および暴言データセットにおける交差的バイアスを調査した。アフリカ系アメリカ人のツイート、特にアフリカ系アメリカン男性のツイートは、他のグループと比較して著しく悪意ある発言や嫌がらせとラベル付けされやすく、政治的帰属を制御しても、悪意ある発言のラベル付け確率が最大3.7倍、嫌がらせのラベル付け確率が77%高いことが判明した。これは、これらのデータセットにおける交差的バイアスに関する、初めての体系的証拠を示している。

ABSTRACT

Algorithms are widely applied to detect hate speech and abusive language in social media. We investigated whether the human-annotated data used to train these algorithms are biased. We utilized a publicly available annotated Twitter dataset (Founta et al. 2018) and classified the racial, gender, and party identification dimensions of 99,996 tweets. The results showed that African American tweets were up to 3.7 times more likely to be labeled as abusive, and African American male tweets were up to 77% more likely to be labeled as hateful compared to the others. These patterns were statistically significant and robust even when party identification was added as a control variable. This study provides the first systematic evidence on intersectional bias in datasets of hate speech and abusive language.

研究の動機と目的

  • 人種、性別、政治的帰属といった交差する社会的アイデンティティの観点から、嫌がらせ発言および暴言データセットにバイアスが存在するかどうかを調査すること。
  • 他のデモグラフィックグループと比較して、アフリカ系アメリカンのツイートが、悪意ある発言や嫌がらせとして不釣り合いに多くラベル付けされているかどうかを特定すること。
  • 政治的加盟を制御した後でも、このようなバイアスが継続するかどうかを評価すること。
  • 嫌がらせ発言検出に広く使われているNLPデータセットにおける交差的バイアスの体系的実証的証拠を提供すること。

提案手法

  • 本研究は、99,996件の人のラベル付けがなされたツイートを含む、公開済みのTwitterデータセット(Founta et al., 2018)を分析した。
  • 各ツイートについて、言語的手がかりと文脈分析を組み合わせて、人種、性別、および政治的加盟を分類した。
  • デモグラフィックアイデンティティとラベル付け結果(悪意ある発言、嫌がらせ)との関連性を検証するために、統計的モデリングを適用した。
  • 多変量回帰モデルを用いて、政治的加盟を制御し、人種および性別のラベル付け結果への影響を分離した。
  • モデル仕様やデータの不均衡に起因するアーティファクトでないかを確認するため、妥当性のチェックを実施した。
  • 交差するカテゴリーごとに、統計的有意性および効果量の観点から結果を評価した。

実験結果

リサーチクエスチョン

  • RQ1嫌がらせ発言データセットにおいて、アフリカ系アメリカンのツイートは他の人種グループと比較して、悪意ある発言や嫌がらせとしてラベル付けされやすいか?
  • RQ2黒人であり男性であるという交差的アイデンティティが、他のデモグラフィックグループと比較して、嫌がらせとしてラベル付けされやすくなるか?
  • RQ3政治的加盟の帰属を制御した後でも、ラベル付けのバイアスは依然として強固か?
  • RQ4人種、性別、政党の交差的アイデンティティが、アノテーション結果の格差にどの程度寄与しているか?

主な発見

  • アフリカ系アメリカンのツイートは、他の人種グループのツイートと比較して、最大3.7倍悪意ある発言としてラベル付けされやすかった。
  • アフリカ系アメリカン男性のツイートは、他のデモグラフィックグループと比較して、最大77%嫌がらせとしてラベル付けされやすかった。
  • 政治的加盟を制御した後でも、これらの格差は統計的に有意であった。
  • バイアスは、複数のデモグラフィック交差において一貫しており、アノテーション結果におけるシステム的歪みを示している。
  • 本研究は、嫌がらせ発言および暴言データセットにおける交差的バイアスに関する、初めての体系的証拠を提供した。
  • 研究結果は、NLPモデルの学習データが、自動コンテンツモデレーションにおける社会的不平等を強化・拡大している可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。