[論文レビュー] Hate Speech Classifiers Learn Human-Like Social Stereotypes
本研究は、嫌がらせ表現分類器が人間らしい社会的ステレオタイプを学習・再現することにより、差別的で偏った予測を生じさせ、とりわけ弱い立場にあるグループに不均等に影響を与えることを示している。社会心理学(IAT)と自然言語処理(NLP)を統合することで、アノテーターの無意識的なバイアスと言語に埋め込まれたステレオタイプの両方が、ニューラル嫌がらせ表現検出器における系統的な誤分類と相関することを示しており、AIモデレーションシステムにおける深刻な不平等の原因を明らかにしている。
Social stereotypes negatively impact individuals' judgements about different groups and may have a critical role in how people understand language directed toward minority social groups. Here, we assess the role of social stereotypes in the automated detection of hateful language by examining the relation between individual annotator biases and erroneous classification of texts by hate speech classifiers. Specifically, in Study 1 we investigate the impact of novice annotators' stereotypes on their hate-speech-annotation behavior. In Study 2 we examine the effect of language-embedded stereotypes on expert annotators' aggregated judgements in a large annotated corpus. Finally, in Study 3 we demonstrate how language-embedded stereotypes are associated with systematic prediction errors in a neural-network hate speech classifier. Our results demonstrate that hate speech classifiers learn human-like biases which can further perpetuate social inequalities when propagated at scale. This framework, combining social psychological and computational linguistic methods, provides insights into additional sources of bias in hate speech moderation, informing ongoing debates regarding fairness in machine learning.
研究の動機と目的
- 個々のアノテーターの無意識的な社会的ステレオタイプが、彼らの嫌がらせ表現ラベル付け行動にどのように影響するかを調査すること。
- テキストに埋め込まれたステレオタイプが、専門的アノテーター間の対立を高めるかどうかを検討すること。
- 社会的ステレオタイプがニューラル嫌がらせ表現分類器における系統的な予測誤差に与える影響を評価すること。
- データおよびアノテーションプロセスにおける人間らしいバイアスがAIモデルにどのように内臓され、社会的不平等を悪化させるかを特定すること。
提案手法
- 参加者の無意識的バイアスを測定するために、8組の社会的グループ(例:黒人対白人、ゲイ対異性愛者)に対するインプリシットアソシエーションテスト(IAT)を実施した。
- 特定の社会的グループを言及する多様なソーシャルメディア投稿のコーパスに対して、124名のアノテーターから嫌がらせ表現のラベルを収集した。
- IATスコア(無意識的バイアス)と、特定の社会的グループを言及するコンテンツに対して割り当てられた嫌がらせラベル数との関係を分析するため、多段階のポアソン回帰モデルを適用した。
- 2標本のパーミュテーション検定を実施し、社会的グループのトークンを含む・含まない投稿、および嫌がらせあり・なしのコンテンツにおけるアノテーター間の対立を比較した。
- 2要因分散分析(two-way ANOVA)を実施し、嫌がらせラベルの有無と社会的グループのトークン存在が、対立スコアに与える交互作用効果を検討した。
- ニューラルネットワークベースの嫌がらせ表現分類器を訓練し、その予測誤差がステレオタイプ的な言語パターンやグループの言及とどのように関連するかを分析した。
実験結果
リサーチクエスチョン
- RQ1IATで測定されたアノテーターの無意識的バイアスは、特定の社会的グループを言及するコンテンツに対して割り当てられる嫌がらせラベル数とどのように相関するか?
- RQ2テキストに社会的グループが言及することで、専門的アノテーター間の対立がどの程度高まるか?
- RQ3嫌がらせ表現の内容と社会的グループのトークンの両方が投稿に存在する場合、アノテーター間の対立は高くなるか、低くなるか?
- RQ4言語に埋め込まれた社会的ステレオタイプは、ニューラル嫌がらせ表現分類器における系統的な誤りにどの程度寄与するか?
主な発見
- アノテーターの特定の社会的グループに対する無意識的バイアススコアが1ポイント上昇すると、そのグループを言及するコンテンツに対して割り当てられる嫌がらせラベル数が0.1%増加する(β = 0.09、p < .01)。
- 嫌がらせとラベル付けされた投稿におけるアノテーター間の対立は、嫌がらせでない投稿(M = 0.13)よりも顕著に高い(M = 0.50)ことが判明し、p < .001であった。
- 社会的グループのトークンが含まれる投稿では、含まれない投稿(M = 0.13)よりも顕著に高い対立が生じた(M = 0.30)、p < .001。
- 2要因分散分析の結果、嫌がらせ表現の有無および社会的グループのトークン存在が、両方とも対立スコアを独立に予測する(両者ともp < .001)。
- ニューラル嫌がらせ表現分類器は、言語内のステレオタイプ的関連性と一致する系統的な予測誤差を示しており、モデルが人間らしい社会的バイアスを学習・強化していることを示している。
- 本研究は、アノテーターのレベルでの無意識的バイアスと言語に埋め込まれたステレオタイプの両方が、不公平なモデル行動を引き起こす要因であることを確認しており、社会的不平等を大規模に強化している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。