Skip to main content
QUICK REVIEW

[論文レビュー] Is Your Toxicity My Toxicity? Exploring the Impact of Rater Identity on Toxicity Annotation

Nitesh Goyal, Ian Kivlichan|arXiv (Cornell University)|May 1, 2022
Hate Speech and Cyberbullying Detection被引用数 5
ひとこと要約

本研究では、オンラインコメントにおける毒性アノテーションにレーティング担当者のアイデンティティがどのように影響するかを調査し、アフリカ系アメリカ人またはLGBTQと自己認識する人々から構成される専門的なレーティングプールが、コントロールプールと比較して毒性評価を著しく異なるものにすることを明らかにした。アイデンティティに特化したレーティング担当者からのアノテーションで訓練されたモデルは、より小さなデータセットでさえも、ランダムなレーティング担当者からのものよりも優れた性能を示した。これは、コミュニティが自らを特定するアノテーターが、より洗練され、包括的で、バイアスの少ないモデルの結果をもたらす可能性があることを示唆している。

ABSTRACT

Machine learning models are commonly used to detect toxicity in online conversations. These models are trained on datasets annotated by human raters. We explore how raters' self-described identities impact how they annotate toxicity in online comments. We first define the concept of specialized rater pools: rater pools formed based on raters' self-described identities, rather than at random. We formed three such rater pools for this study--specialized rater pools of raters from the U.S. who identify as African American, LGBTQ, and those who identify as neither. Each of these rater pools annotated the same set of comments, which contains many references to these identity groups. We found that rater identity is a statistically significant factor in how raters will annotate toxicity for identity-related annotations. Using preliminary content analysis, we examined the comments with the most disagreement between rater pools and found nuanced differences in the toxicity annotations. Next, we trained models on the annotations from each of the different rater pools, and compared the scores of these models on comments from several test sets. Finally, we discuss how using raters that self-identify with the subjects of comments can create more inclusive machine learning models, and provide more nuanced ratings than those by random raters.

研究の動機と目的

  • レーティング担当者の自己認識されたアイデンティティが、人種および性的指向に関するコメントの毒性アノテーションに影響を与えるかどうかを検証すること。
  • アフリカ系アメリカ人やLGBTQなどのアイデンティティグループに基づく専門的レーティングプールが、ランダムなレーティング担当者と比較して、より洗練され、バイアスの少ないアノテーションを生み出すかどうかを評価すること。
  • アイデンティティに特化したレーティング担当者からのアノテーションで訓練されたモデルが、ランダムなアノテーターのデータで訓練されたモデルを上回る性能を示すかどうかを評価すること。
  • 今後の研究を支援するために、3つのキュレートされたレーティングプールから得られた382,500件のアノテーションを含む公開可能なデータセットを構築・リリースすること。
  • バイアスを低減するため、機械学習パイプラインにアイデンティティに基づくアノテーターのプールを統合するよう提言すること。

提案手法

  • 3つの専門的レーティングプールを構築した:自己認識されたアフリカ系アメリカ人、LGBTQ、および両方のアイデンティティに該当しない者。それぞれが、Civil Commentsデータセットからの同じ25,500件のコメントをアノテートした。
  • レーティング担当者のデモグラフィック自己認識を主たるグループ化基準とする、制御されたアイデンティティベースのレーティングプールフレームワークを用いてアノテーションを収集した。
  • 統計的分析を用いて、レーティングプール間での毒性評価の差を比較し、レーティング担当者のアイデンティティに起因する有意差を同定した。
  • プール間で高い不一致を示したコメントに対してコンテンツ分析を実施し、不一致の原因となる言語的・文脈的マーカーを同定した。
  • 各レーティングプールからのアノテーションで訓練された複数の機械学習モデルを構築し、さまざまなテストセットで性能を比較した。
  • 本研究では、3つの専門的レーティングプールから得た382,500件のアノテーションを含む新しいデータセットをリリースし、再現性とさらなる研究を可能にした。

実験結果

リサーチクエスチョン

  • RQ1レーティング担当者の自己認識されたアイデンティティが、人種および性的指向に関するコメントの毒性アノテーションに有意に影響を与えるか?
  • RQ2アフリカ系アメリカ人およびLGBTQのアイデンティティ特化型レーティングプールの毒性評価は、コントロールプール(アフリカ系アメリカ人およびLGBTQに該当しない者)とどのように異なるか?
  • RQ3より小さなデータセットでさえも、専門的レーティングプールからのアノテーションで訓練されたモデルが、ランダムなレーティング担当者からのデータで訓練されたモデルを上回る性能を示せるか?
  • RQ4専門的レーティングプールとコントロールプールとの間の評価差を説明する言語的または文脈的特徴は何か?
  • RQ5アイデンティティに基づくレーティングプールは、どのようにして毒性検出モデルの公平性と包括性を向上させられるか?

主な発見

  • レーティング担当者のアイデンティティは、毒性アノテーションにおいて統計的に有意な要因であった。アフリカ系アメリカ人およびLGBTQのレーティング担当者は、アイデンティティ関連のコメントに対してコントロールプールとは異なる評価を下した。
  • アイデンティティ攻撃、脅し、乱暴な言葉遣いのカテゴリで、専門的レーティングプールとコントロールプールとの間で評価の差が最も顕著に見られた。
  • 専門的レーティングプールからのアノテーションで訓練されたモデルは、より大きなデータセットでランダムなレーティング担当者から得たデータで訓練されたモデルよりも優れた性能を示した。これは、より高品質で洗練されたラベル付けがなされていることを示唆している。
  • 本研究がリリースした382,500件のアノテーションを含むデータセットは、3つの専門的レーティングプールから得られたものであり、今後の研究やモデル評価を支援するために公開された。
  • 予備的なコンテンツ分析から、マイクロアグレッションのような、洗練されたコミュニティ固有の言語的マーカーが、アイデンティティ特化型レーティング担当者によってより正確に同定されていることが明らかになった。
  • 研究結果から、コミュニティが自らを特定するアノテーターを参加させることで、毒性検出のための機械学習モデルがより包括的で、バイアスの少ないものになると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。