Skip to main content
QUICK REVIEW

[论文解读] Designing Toxic Content Classification for a Diversity of Perspectives

Deepak Kumar, Patrick Gage Kelley|arXiv (Cornell University)|Jun 4, 2021
Hate Speech and Cyberbullying Detection参考文献 38被引用 11
一句话总结

本文提出个性化毒性分类模型,通过根据调查数据中17,280名参与者(涵盖多样化人口统计学特征和经历)的个体用户视角调整分类器阈值,平均将准确率提升86%。研究证明,像Perspective API这样的‘一刀切’分类器因无法适应不同用户对毒性的感知差异,尤其在边缘化群体中表现不佳,难以实现泛化。

ABSTRACT

In this work, we demonstrate how existing classifiers for identifying toxic comments online fail to generalize to the diverse concerns of Internet users. We survey 17,280 participants to understand how user expectations for what constitutes toxic content differ across demographics, beliefs, and personal experiences. We find that groups historically at-risk of harassment - such as people who identify as LGBTQ+ or young adults - are more likely to to flag a random comment drawn from Reddit, Twitter, or 4chan as toxic, as are people who have personally experienced harassment in the past. Based on our findings, we show how current one-size-fits-all toxicity classification algorithms, like the Perspective API from Jigsaw, can improve in accuracy by 86% on average through personalized model tuning. Ultimately, we highlight current pitfalls and new design directions that can improve the equity and efficacy of toxic content classifiers for all users.

研究动机与目标

  • 调查不同用户背景、经历和信念如何影响其对网络毒性的感知。
  • 识别像Perspective API这样的‘一刀切’毒性分类器在捕捉多样化用户视角方面的局限性。
  • 评估个人遭受骚扰的经历和身份认同对毒性判断的影响。
  • 开发并测试个性化调优策略,以提升在多样化用户群体中的分类器准确率。
  • 为未来毒性分类研究提供公开可获取的数据集和方法论最佳实践。

提出的方法

  • 通过Mechanical Turk在美国招募17,280名参与者,开展大规模调查,要求其对Reddit、Twitter和4chan中随机选取的20条评论进行毒性评分。
  • 收集人口统计学数据、个人遭受网络骚扰的经历以及对内容过滤的态度,以分析影响因素。
  • 采用每条评论五级评分法,在成本与标注准确率之间取得平衡,确立未来众包标注的最佳实践。
  • 将现有分类器(如Perspective API、Instagram的nudge)与参与者共识进行对比评估,发现在高置信度阈值下,50%的案例中存在显著分歧。
  • 提出针对个人或人口群体的个性化阈值调优方法,以提升分类器与用户视角的一致性。
  • 通过个体和人口群体层面的准确率指标,比较全局阈值与个性化阈值的性能提升。

实验结果

研究问题

  • RQ1身份认同、个人遭受骚扰的经历以及对内容过滤的态度在多大程度上影响用户对网络毒性的感知?
  • RQ2现有的‘一刀切’毒性分类器(如Perspective API)在多大程度上与多样化用户判断保持一致?
  • RQ3个性化阈值调优是否能显著提升个体用户的毒性分类准确率?
  • RQ4在众包研究中,哪些标注实践最有效捕捉细微且情境敏感的毒性判断?
  • RQ5毒性分类器在不同在线社区(如Reddit、Twitter、4chan)和用户群体中的表现有何差异?

主要发现

  • 53%的评论被参与者标记为‘非毒性’,39%为‘轻微’或‘中度’毒性,8%为‘非常’或‘极度’毒性,表明评分者之间存在显著分歧。
  • 85%的评论在毒性评分上存在某种程度的分歧,即使在参与者对毒性达成一致的情况下也是如此,凸显了该任务的高度主观性。
  • 自我认同为LGBTQ+的参与者将某条评论评为毒性的可能性高出1.64倍,而频繁目睹骚扰的参与者则低22%(优势比0.78),表明可能存在麻木化效应。
  • 尽管Perspective API在90%置信度阈值下运行,仅有50%的参与者认同其毒性判断,揭示了其与用户感知之间存在重大错位。
  • 个性化调优分类器阈值使每位用户的平均准确率提升86%,其中按年龄分组的模型表现最佳(最高提升20.6%)。
  • 本研究发布了包含17,280条毒性评分、覆盖107,620条评论的公开数据集,以支持未来研究和模型开发。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。