Skip to main content
QUICK REVIEW

[論文レビュー] Designing Toxic Content Classification for a Diversity of Perspectives

Deepak Kumar, Patrick Gage Kelley|arXiv (Cornell University)|Jun 4, 2021
Hate Speech and Cyberbullying Detection参考文献 38被引用数 11
ひとこと要約

本稿では、17,280名の多様な背景と経験を持つ参加者からのアンケートデータに基づき、個々のユーザーの視点に合わせて分類器のしきい値を調整することで、平均で86%の精度向上を達成する、パーソナライズドな中毒性分類モデルを提案している。この研究は、特にマイノリティグループにおいて、中毒性の認識が大きく異なることから、Perspective APIのような一様な分類器が一般化できないことを示している。

ABSTRACT

In this work, we demonstrate how existing classifiers for identifying toxic comments online fail to generalize to the diverse concerns of Internet users. We survey 17,280 participants to understand how user expectations for what constitutes toxic content differ across demographics, beliefs, and personal experiences. We find that groups historically at-risk of harassment - such as people who identify as LGBTQ+ or young adults - are more likely to to flag a random comment drawn from Reddit, Twitter, or 4chan as toxic, as are people who have personally experienced harassment in the past. Based on our findings, we show how current one-size-fits-all toxicity classification algorithms, like the Perspective API from Jigsaw, can improve in accuracy by 86% on average through personalized model tuning. Ultimately, we highlight current pitfalls and new design directions that can improve the equity and efficacy of toxic content classifiers for all users.

研究の動機と目的

  • 多様なユーザーの背景、経験、価値観がオンラインの中毒性の認識にどのように影響するかを調査すること。
  • Perspective APIのような一様な中毒性分類器が、多様なユーザーの視点を捉えきれない限界を特定すること。
  • いじめの経験やデモグラフィックアイデンティティが中毒性判断に与える影響を評価すること。
  • 多様なユーザー層にわたる分類器の精度を向上させるためのパーソナライズドチューニング戦略を開発・検証すること。
  • 今後の研究における中毒性分類分野のための公開データセットおよびメソドロジカルベストプラクティスを提供すること。

提案手法

  • Mechanical Turkを通じて米国在住の17,280名の参加者を対象に大規模なアンケート調査を実施し、Reddit、Twitter、4chanのコメントからランダムに選択された20件のコメントについて、中毒性を評価してもらった。
  • デモグラフィックデータ、オンラインいじめの経験、コンテンツフィルタリングに対する態度を収集し、影響要因を分析した。
  • コストとラベル精度のバランスを図るために、1コメントあたり5段階の評価を採用し、今後のクラウドソーシングラベリングにおけるベストプラクティスを確立した。
  • 参加者のコンSENSUSと比較して、既存の分類器(例:Perspective API、Instagramのnudge)の性能を評価した。その結果、高信頼度のしきい値でも50%のケースで著しい合意のずれが生じた。
  • ユーザーの視点に合わせて、個々人またはデモグラフィック集団ごとに分類器のしきい値をパーソナライズドにチューニングする手法を提案した。
  • 個々人およびデモグラフィックグループごとの精度指標を用いて、グローバルなしきい値とパーソナライズドなしきい値の性能向上を測定した。

実験結果

リサーチクエスチョン

  • RQ1デモグラフィックアイデンティティ、いじめの経験、コンテンツフィルタリングに対する態度が、ユーザーのオンライン中毒性認識にどのように影響するか?
  • RQ2Perspective APIのような一様な中毒性分類器が、多様なユーザーの判断とどの程度一致しているか?
  • RQ3パーソナライズドなしきい値チューニングは、個々のユーザーの中毒性分類精度を著しく向上させることができるか?
  • RQ4クラウドソーシング研究において、微細で文脈依存の中毒性判断を的確に捉えるための最も効果的なラベリング手法は何か?
  • RQ5中毒性分類器の性能は、Reddit、Twitter、4chanなどの異なるオンラインコミュニティおよびユーザー層においてどのように変動するか?

主な発見

  • 53%のコメントが参加者によって「中毒性なし」と評価され、39%が「軽度」または「中程度の中毒性」とされ、8%が「非常に」または「極めて中毒性がある」とされた。これは、ラベラー間での著しい合意のずれを示している。
  • 85%のコメントで、中毒性評価に何らかの合意のずれが生じており、中毒性に合意する参加者間でも、依然として主観的な性質が顕著に現れている。
  • LGBTQ+と自己認識する参加者は、コメントを中毒性があると評価する可能性が1.64倍高かった。一方、いじめを頻繁に目撃した参加者は22%低い確率(オッズ比0.78)で中毒性があると評価した。これは、感覚鈍麻効果の可能性を示唆している。
  • Perspective APIでは90%の信頼度を設定していたが、参加者のうち50%しかその中毒性判断に同意しなかった。これは、ユーザーの認識と著しく乖離していることを示している。
  • 分類器のしきい値を個々のユーザーごとにパーソナライズドにチューニングすることで、平均で86%の精度向上が達成された。特に年齢別モデルでは、最大20.6%の向上が見られた。
  • 本研究では、107,620件のコメントについて17,280件の中毒性評価を含む、公開可能なデータセットをリリースした。今後の研究およびモデル開発を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。