Skip to main content
QUICK REVIEW

[論文レビュー] Vicarious Offense and Noise Audit of Offensive Speech Classifiers: Unifying Human and Machine Disagreement on What is Offensive

Tharindu Cyril Weerasooriya, Sujan Dutta|arXiv (Cornell University)|Jan 29, 2023
Hate Speech and Cyberbullying Detection被引用数 5
ひとこと要約

本論文は、政治的ディスcourseにおける人間および機械のモデレーター間の攻撃的発言分類に関する合意の欠如を調査する大規模なノイズ監査と、『代わって攻撃を受ける』という画期的な概念を導入する。その結果、モデレーティングの結果に広範なばらつきが生じ、人間や大規模言語モデルの両方が、特に異なる政治的立場を持つ人々が攻撃的コンテンツをどのように感じるかを信頼性を持って予測できないことが明らかになった。

ABSTRACT

Offensive speech detection is a key component of content moderation. However, what is offensive can be highly subjective. This paper investigates how machine and human moderators disagree on what is offensive when it comes to real-world social web political discourse. We show that (1) there is extensive disagreement among the moderators (humans and machines); and (2) human and large-language-model classifiers are unable to predict how other human raters will respond, based on their political leanings. For (1), we conduct a noise audit at an unprecedented scale that combines both machine and human responses. For (2), we introduce a first-of-its-kind dataset of vicarious offense. Our noise audit reveals that moderation outcomes vary wildly across different machine moderators. Our experiments with human moderators suggest that political leanings combined with sensitive issues affect both first-person and vicarious offense. The dataset is available through https://github.com/Homan-Lab/voiced.

研究の動機と目的

  • ソーシャルメディアにおける政治的ディスcourseにおける攻撃的発言を特定する人間および機械のモデレーター間の合意の程度を調査すること。
  • 制御されたデータセットを超えた大規模で現実世界の評価が不足している攻撃的発言分類器の評価の欠如に対処すること。
  • 『代わって攻撃を受ける』という概念を提唱すること—すなわち、異なる政治的アイデンティティを持つ人々がそのコンテンツをどのように攻撃的と感じるかを個人がどのように認識するか。
  • 政治的立場が、第一人称および代わって攻撃を受ける攻撃的発言の認識にどのように影響するかを評価すること。
  • 大規模言語モデルおよび従来の分類器が、攻撃的発言判断における人間の合意の欠如を予測できるかを評価すること。

提案手法

  • 政治的不一致が確認された大規模なYouTubeコメントデータセットを用い、9体の機械モデレーター(GPT-3.5などのLLMおよび非LLMモデルを含む)と人間のラベラーを用いてノイズ監査を実施する。
  • 構造化されたプロンプトフォーマット(「[党A] がこのコメントをどれほど攻撃的だと感じると思いますか?」)を用いて、第一人称(個人的)および代わって攻撃を受ける攻撃的発言の認識に関する人間のアノテーションを収集する。
  • 多数決投票を用いて機械および人間モデレーターの判断を統合し、システム間および政治的グループ間での比較を可能にする。
  • デモクラット、レピブリカン、および独立支持者の視点から、人間ラベルによる代わって攻撃を受ける攻撃的発言のアノテーションを集めた、画期的なVOICEDデータセットを提供する。
  • F1スコア、適合率、再現率などの指標を用いてモデルのパフォーマンスを評価し、GPT-3.5などのLLMと、Perspective API、Detoxifyなどの非LLM分類器を人間のコンSENSUSと比較する。
  • カーニーマンらのフレームワークを模倣したノイズ監査フレームワークを適用し、熟練した意思決定システム間での結果のばらつきを測定する。各モデレーターを独立した意思決定者として扱う。
Figure 1: An illustrative example from YouTube comments on CNN news videos highlighting nuanced inconsistencies between machine moderators and human moderators with different political leanings. We use the majority vote to aggregate individual machine and human moderator’s verdicts. Here a green che
Figure 1: An illustrative example from YouTube comments on CNN news videos highlighting nuanced inconsistencies between machine moderators and human moderators with different political leanings. We use the majority vote to aggregate individual machine and human moderator’s verdicts. Here a green che

実験結果

リサーチクエスチョン

  • RQ1人間および機械モデレーター間で、攻撃的発言を特定する際にどれほど合意の欠如が生じているか?
  • RQ2政治的立場が第一人称および代わって攻撃を受ける攻撃的発言の認識に、どの程度影響を及ぼすか?
  • RQ3大規模言語モデルは、他の人々—特に反対の政治的立場を持つ人々—が攻撃的コンテンツをどのように判断するかを正確に予測できるか?
  • RQ4機械モデレーターは、個人的攻撃的発言および代わって攻撃を受ける攻撃的発言を識別する際、人間モデレーターと比べてどの程度のパフォーマンスを示すか?
  • RQ5『代わって攻撃を受ける』という概念は、攻撃的発言検出における人間と機械の合意の欠如を統合的に理解するのに役立つか?

主な発見

  • 人間および機械モデレーター間で攻撃的コンテンツのラベル付けに関して広範な合意の欠如が生じており、有名な分類器間ですら、モデレーティング結果に高いばらつきが見られた。
  • 機械モデレーター(GPT-3.5や非LLMモデルを含む)は顕著な不一致を示し、人間のコンセンサスと高い一致を示すモデルは存在しなかった。
  • 異なる政治的立場を持つ人間モデレーターは、個人的攻撃的発言だけでなく、代わって攻撃を受ける攻撃的発言についても合意が得られず、政治的極化が個人経験を超えて攻撃的と感じられるかどうかに影響を与えていることが示された。
  • ChatGPTなどの大規模言語モデルは、代わって攻撃を受ける攻撃的発言を予測する能力が限定的であり、人間ラベラーとの合意は低く、むしろ機械モデレーターの多数派の判断に近い結果を示した。これは、主観的認識をモデル化する際の課題を浮き彫りにした。
  • 本研究では、政治的アイデンティティが第一人称および代わって攻撃を受ける攻撃的発言の認識に顕著に影響することが判明した。独立支持者はしばしば中間地点として機能し、デモクラットとレピブリカンは判断で乖離していた。
  • 制御されたアノテーションパイプラインを用いて収集されたVOICEDデータセットは、代わって攻撃を受ける攻撃的発言を研究するための新しいベンチマークを提供し、今後の研究のために公開されている。
(a) Temporal trend showing number of comments made about news videos on three news networks’ official YouTube channels over time.
(a) Temporal trend showing number of comments made about news videos on three news networks’ official YouTube channels over time.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。