[论文解读] Detecting Abusive Language on Online Platforms: A Critical Analysis.
本文批判性地分析了在线平台内容审核目标与当前关于滥用语言检测的自然语言处理(NLP)研究之间的差距,揭示了现实世界审核优先事项与学术研究焦点之间的不匹配。本文综述了现有的检测方法和平台政策,倡导采用上下文感知、包容性且基于伦理的方法,以提升在不同社群中识别滥用语言的公平性与有效性。
Abusive language on online platforms is a major societal problem, often leading to important societal problems such as the marginalisation of underrepresented minorities. There are many different forms of abusive language such as hate speech, profanity, and cyber-bullying, and online platforms seek to moderate it in order to limit societal harm, to comply with legislation, and to create a more inclusive environment for their users. Within the field of Natural Language Processing, researchers have developed different methods for automatically detecting abusive language, often focusing on specific subproblems or on narrow communities, as what is considered abusive language very much differs by context. We argue that there is currently a dichotomy between what types of abusive language online platforms seek to curb, and what research efforts there are to automatically detect abusive language. We thus survey existing methods as well as content moderation policies by online platforms in this light, and we suggest directions for future work.
研究动机与目标
- 识别在线平台旨在审核的滥用语言类型与当前NLP研究范围之间的脱节。
- 检查现有的NLP方法在检测滥用语言方面的表现,并评估其与实际平台内容审核政策的契合度。
- 指出对滥用的定义具有情境依赖性,这导致检测与审核结果的一致性不足。
- 提出未来研究方向,强调在滥用语言检测系统中优先考虑上下文理解、公平性与包容性。
- 鼓励NLP研究人员与平台开发人员合作,弥合学术创新与实际审核需求之间的差距。
提出的方法
- 对现有NLP方法在滥用语言检测方面的技术方法与局限性进行比较性调查。
- 分析主要在线平台公开的内容审核政策,以理解其对滥用语言的定义与优先事项。
- 映射以研究为导向的检测技术与平台特定政策目标之间的契合度,识别关键不匹配之处。
- 根据其上下文敏感性、对特定社群的适用性以及在代表性不足群体中的公平性,评估检测方法。
- 通过定性与比较性分析,识别当前研究中的重复性缺陷,例如对狭窄数据集或二元分类任务的过度依赖。
- 提出一个未来研究框架,强调上下文感知、多情境及以公平为中心的检测模型。
实验结果
研究问题
- RQ1在线平台在其内容审核政策中优先关注哪些类型的滥用语言?
- RQ2当前NLP研究在检测滥用语言方面的方法如何与这些平台优先事项保持一致?
- RQ3对滥用的上下文与社群特定定义在多大程度上挑战了现有检测模型的泛化能力?
- RQ4当前NLP方法在捕捉不同社会语境下滥用语言细微差别的关键局限性是什么?
- RQ5未来NLP研究如何能更好地支持在线平台的公平且有效的内容审核?
主要发现
- 在线平台希望审核的滥用语言类型与当前NLP研究的范围之间存在显著不匹配,后者往往集中于狭隘且高曝光度的形式,如仇恨言论。
- 许多NLP检测方法未能考虑语境相关的滥用表达,导致在实际应用中出现较高的假阳性或假阴性率。
- 研究工作常常忽视代表性不足社群的需求,导致模型产生偏见,使本已脆弱的群体进一步被边缘化。
- 平台政策通常包含细微的滥用类别——如微侵略行为或基于语气的骚扰——这些在学术数据集和模型中代表性不足。
- 当前的检测系统主要基于公开的、英语为主的语料库进行训练,限制了其在多语言或文化特定滥用形式中的适用性。
- 缺乏反映现实世界审核优先事项的标准化评估基准,阻碍了公平且上下文敏感的检测系统的发展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。