[论文解读] Vicarious Offense and Noise Audit of Offensive Speech Classifiers: Unifying Human and Machine Disagreement on What is Offensive
本文通过大规模噪声审计和新颖的‘代际冒犯’概念,研究了在政治话语中人类与机器审核员在识别冒犯性言论时的分歧。研究揭示了审核结果存在广泛变异性,并表明无论是人类还是大型语言模型,都无法可靠预测他人——尤其是政治立场不同者——对冒犯性内容的感知。
Offensive speech detection is a key component of content moderation. However, what is offensive can be highly subjective. This paper investigates how machine and human moderators disagree on what is offensive when it comes to real-world social web political discourse. We show that (1) there is extensive disagreement among the moderators (humans and machines); and (2) human and large-language-model classifiers are unable to predict how other human raters will respond, based on their political leanings. For (1), we conduct a noise audit at an unprecedented scale that combines both machine and human responses. For (2), we introduce a first-of-its-kind dataset of vicarious offense. Our noise audit reveals that moderation outcomes vary wildly across different machine moderators. Our experiments with human moderators suggest that political leanings combined with sensitive issues affect both first-person and vicarious offense. The dataset is available through https://github.com/Homan-Lab/voiced.
研究动机与目标
- 调查人类与机器审核员在社交媒体政治话语中识别冒犯性言论时的分歧程度。
- 解决现有研究中缺乏对冒犯性言论分类器在真实世界场景下的大规模评估,而不仅限于受控数据集的问题。
- 提出‘代际冒犯’概念——即个体感知某内容是否会使具有不同政治身份的他人感到冒犯。
- 评估政治立场是否影响对第一人称冒犯和代际冒犯的感知。
- 评估大型语言模型和传统分类器预测人类在冒犯性言论判断中分歧的能力。
提出的方法
- 在具有已知政治分歧的大规模YouTube评论数据集上,使用9个机器审核员(包括GPT-3.5等大语言模型和非大语言模型)及人类评分员开展噪声审计。
- 通过结构化提示格式收集人类对第一人称(个人)和代际冒犯感知的标注:'你认为[政党A]会如何看待这条评论的冒犯性?'
- 采用多数投票机制聚合机器与人类审核员的判断,实现不同系统和政治群体之间的对比。
- 推出VOICED数据集——首个包含民主党、共和党和独立派视角的人工标注代际冒犯标注的集合。
- 使用F1、精确率和召回率等指标评估模型性能,将大语言模型(如ChatGPT)与非大语言模型分类器(如Perspective API、Detoxify)与人类共识进行对比。
- 采用受Kahneman等人启发的噪声审计框架,衡量在能力可靠的决策系统中结果的变异性,将每位审核员视为独立的决策者。

实验结果
研究问题
- RQ1人类与机器审核员在标注冒犯性政治话语时存在多大程度的分歧?
- RQ2政治立场在多大程度上影响对第一人称冒犯和代际冒犯的感知?
- RQ3大型语言模型能否准确预测他人——尤其是持对立政治观点者——对冒犯性内容的判断?
- RQ4机器审核员在识别个人冒犯和代际冒犯方面,与人类审核员的表现相比如何?
- RQ5代际冒犯概念能否帮助统一理解人类与机器在冒犯性言论检测中的分歧?
主要发现
- 人类与机器审核员在标注冒犯性内容方面存在广泛分歧,即使在知名分类器之间,审核结果也表现出高度变异性。
- 机器审核员(包括GPT-3.5和非大语言模型)表现出显著不一致性,无单一模型能与人类共识达成高一致度。
- 具有不同政治立场的人类审核员不仅在个人冒犯上存在分歧,也在代际冒犯上产生分歧,表明政治极化影响了冒犯性的感知,超出了个人经验范畴。
- 如ChatGPT等大型语言模型在预测代际冒犯方面能力有限,与人类评分员的一致性较低,而更接近机器审核员的多数意见,凸显了建模主观感知的挑战。
- 研究发现政治身份显著影响第一人称和代际冒犯的感知,独立派常作为中间立场,而民主党和共和党在判断上存在明显分歧。
- 通过受控标注流程收集的VOICED数据集,为研究代际冒犯提供了新基准,且对公众开放,可供未来研究使用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。