Skip to main content
QUICK REVIEW

[論文レビュー] Annotators with Attitudes: How Annotator Beliefs And Identities Bias Toxic Language Detection

Maarten Sap, Swabha Swayamdipta|arXiv (Cornell University)|Nov 15, 2021
Hate Speech and Cyberbullying Detection被引用数 7
ひとこと要約

本稿は、被験者本人のアイデンティティと信念——特に政治的保守主義と人種的偏見——が、有毒な言語検出にどのようにバイアスをもたらすかを調査する。多様な参加者を対象とした2つのオンライン研究を通じて、保守的で人種的偏見の強い被験者は、反ブラックな言語を有毒と評価する傾向が低く、一方でアフリカ系アメリカン英語(AAE)を有毒と評価する傾向が高いことが示された。これは、ラベル付けにおける体系的な主観性を明らかにする。さらに、PerspectiveAPIのような一般的なシステムも、こうした被験者バイアスを反映しており、自動化された検出における公平性を損なっていることが示された。

ABSTRACT

The perceived toxicity of language can vary based on someone's identity and beliefs, but this variation is often ignored when collecting toxic language datasets, resulting in dataset and model biases. We seek to understand the who, why, and what behind biases in toxicity annotations. In two online studies with demographically and politically diverse participants, we investigate the effect of annotator identities (who) and beliefs (why), drawing from social psychology research about hate speech, free speech, racist beliefs, political leaning, and more. We disentangle what is annotated as toxic by considering posts with three characteristics: anti-Black language, African American English (AAE) dialect, and vulgarity. Our results show strong associations between annotator identity and beliefs and their ratings of toxicity. Notably, more conservative annotators and those who scored highly on our scale for racist beliefs were less likely to rate anti-Black language as toxic, but more likely to rate AAE as toxic. We additionally present a case study illustrating how a popular toxicity detection system's ratings inherently reflect only specific beliefs and perspectives. Our findings call for contextualizing toxicity labels in social variables, which raises immense implications for toxic language annotation and detection.

研究の動機と目的

  • 被験者本人のアイデンティティと信念が、言語アノテーションにおける有毒度評価にどのように影響するかを調査すること。
  • 政治的傾向、人種的バイアス、言語的背景が、テキストの不快さや差別的表現の認識に与える影響を検討すること。
  • PerspectiveAPIのような一般的な有毒度検出システムが、特定の被験者グループのバイアスを反映しているかどうかを評価すること。
  • NLPデータセットやモデルにおける、客観的で普遍的な有毒度ラベルの仮定に疑問を呈すること。
  • 有毒度アノテーションを社会的・人口統計的変数の文脈に組み込むよう提言すること。

提案手法

  • 人種的・性的・政治的多様性を持つ参加者を対象とした2つのオンライン研究を実施し、15件の選別済み投稿および約600件の投稿に対する有毒度評価を収集した。
  • 検証済み心理尺度を用いて被験者のアイデンティティ(人種、性別、政治的傾向)と態度(人種的偏見、言論の自由に関する見解、伝統的価値観)を測定した。
  • 個々の被験者差を制御した線形混合効果モデルを用いて、被験者特性と有毒度評価の関係を分析した。
  • PerspectiveAPIスコアと被験者評価のピアソン相関を算出し、Fisherのr-to-z変換を適用して、高得点・低得点被験者グループ間で有意な差があるかを検定した。
  • 反ブラックな言語、アフリカ系アメリカン英語(AAE)、下品な言語という3つのテキストカテゴリを分析し、バイアスの原因を解明した。
  • 効果量(Cohenのd、ピアソンのr)とp値にホルム補正を適用して、統計的有意性と妥当性を評価した。

実験結果

リサーチクエスチョン

  • RQ1被験者本人のアイデンティティ(例:人種、性別、政治的傾向)は、テキストの有毒度評価にどのように影響するか?
  • RQ2被験者の信念——特に人種的偏見や言論の自由に関する見解——は、不快さや差別的表現の認識にどのように影響するか?
  • RQ3反ブラックな言語、AAE、下品さといった異なるテキスト特性が、被験者本人のアイデンティティと信念に基づいて、どのように異なる有毒度評価を引き起こすか?
  • RQ4既存の自動有毒度検出システム(例:PerspectiveAPI)は、特定の被験者グループのバイアスをどの程度反映しているか?
  • RQ5集計された有毒度ラベルは、有毒度認識の主観性と社会的文脈をどのように隠蔽しているか?

主な発見

  • 保守的被験者は、反ブラックな言語を有毒と評価する可能性が有意に低く、効果量はd = 0.34~d = 0.58(p < 0.001)の範囲であった。
  • 人種的偏見尺度で高いスコアを出した被験者は、反ブラックなコンテンツを有毒と評価する可能性が低かった(r = -0.21、p < 0.001)、すなわち強い負の相関が示された。
  • 保守的・伝統的価値観を持つ被験者は、リベラルまたはプログレッシブな被験者よりもAAEを有意に有毒と評価した(d = 0.41、p < 0.001)。
  • 人種的偏見の強い被験者は、AAEを差別的であると評価する傾向が高かった(r = 0.23、p < 0.001)、これは方言を悪意と混同している可能性を示唆している。
  • 下品な言語については、保守的・伝統的価値観を持つ被験者がより不快に感じた(d = 0.38、p < 0.001)、ただし人種的・性的要因には依存しなかった。
  • PerspectiveAPIスコアは、人種的偏見の強い被験者による反ブラックなコンテンツの評価と強く相関していた(r = 0.31、p < 0.001)、これによりモデルがこうしたバイアスを反映していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。