[论文解读] Impact of Sentiment Detection to Recognize Toxic and Subversive Online Comments
本文提出将情感检测整合到毒性检测系统中,以应对通过改变有毒词汇来规避基于关键词过滤的操纵性用户。利用真实世界数据集训练的神经网络表明,在遭受操纵的情况下,引入情感信息可将毒性检测准确率提升高达3%,证实情感比关键词更难伪装。
The presence of toxic content has become a major problem for many online communities. Moderators try to limit this problem by implementing more and more refined comment filters, but toxic users are constantly finding new ways to circumvent them. Our hypothesis is that while modifying toxic content and keywords to fool filters can be easy, hiding sentiment is harder. In this paper, we explore various aspects of sentiment detection and their correlation to toxicity, and use our results to implement a toxicity detection tool. We then test how adding the sentiment information helps detect toxicity in three different real-world datasets, and incorporate subversion to these datasets to simulate a user trying to circumvent the system. Our results show sentiment information has a positive impact on toxicity detection against a subversive user.
研究动机与目标
- 探究在线评论中情感与毒性之间的相关性。
- 使用词典和语言学特征开发情感检测工具,以集成到毒性检测系统中。
- 评估情感信息是否能提升毒性检测性能,尤其是在遭受操纵的情况下。
- 通过将有毒关键词替换为同音词或拼写错误来模拟操纵性行为,以测试系统的鲁棒性。
- 评估情感对不同真实世界数据集(Kaggle、Wikipedia、Reddit)中毒性检测的影响。
提出的方法
- 使用多种情感词典(SentiS、VADER、SentiStrength)和语言学特征(如词频、否定处理)构建情感检测系统。
- 使用文本嵌入和情感得分作为输入特征,训练深度神经网络进行毒性检测。
- 通过应用替换列表,模拟操纵性用户行为,将191个常见有毒关键词替换为同音词或拼写错误(例如,'kill' → 'kilt')。
- 在三个数据集(Kaggle、Wikipedia、Reddit)上进行实验,采用70%训练、20%验证、10%测试的划分方式,每个数据集进行三次随机运行。
- 在干净和操纵两种条件下,对比包含和不包含情感输入的检测准确率。
- 通过欠采样非毒性消息使每个语料库中非毒性消息的数量与毒性消息数量匹配,以构建平衡数据集。
实验结果
研究问题
- RQ1在线评论中,情感与毒性之间是否存在显著相关性?
- RQ2情感信息能否在标准和操纵情境下提升毒性检测的准确性?
- RQ3当有毒用户通过修改关键词以逃避基于关键词的过滤时,基于情感的检测效果如何?
- RQ4在毒性-情感相关性各异的不同数据集中,情感检测带来的性能增益是否有所不同?
- RQ5当基于关键词的系统因操纵而失效时,情感检测能否帮助识别毒性?
主要发现
- 在所有三个数据集中,负面情感与毒性之间存在明显相关性,情感得分与毒性标签表现出强烈的一致性。
- 在干净条件下(无操纵),情感信息的引入使毒性检测准确率平均提升0.5%,在Reddit上提升较小(0.1%),可能是因为其情感-毒性相关性较弱。
- 在操纵条件下,65–82%的有毒消息通过同音替换被修改,未使用情感信息的模型准确率显著下降(例如,Kaggle数据集从93.2%降至77.2%),但加入情感信息后准确率得以提升。
- 在操纵的Kaggle数据集中,情感信息的加入使检测准确率提升了2.9%(从77.2%提升至80.1%),Wikipedia数据集(从81.4%提升至82.0%)和Reddit数据集(从83.0%提升至83.9%)也观察到类似增益。
- 情感检测在操纵场景下带来的性能提升最大,证实情感比词汇内容更具抗混淆能力。
- 即使不使用情感信息,模型在基线条件下也达到了较高准确率(例如,干净Kaggle数据集为93.2%),这可能归因于深度学习模型在字符级编码和噪声容忍方面的强大能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。