[论文解读] Contextual Lexicon-Based Approach for Hate Speech and Offensive Language Detection.
本文提出了一种基于上下文词典的方法,用于检测巴西葡萄牙语中的仇恨言论和冒犯性语言,利用了经人工标注的、按上下文依赖或上下文独立分类的冒犯性表达词典。该方法在葡萄牙语数据集上实现了最先进性能,在冒犯性语言和仇恨言论检测任务中均优于现有基线模型。
This paper provides a new approach for offensive language and hate speech detection on social media. Our approach incorporates an offensive lexicon composed of implicit and explicit offensive and swearing expressions annotated with binary classes: context-dependent and context-independent offensive. Due to the severity of the hate speech and offensive comments in Brazil, and the lack of research in Portuguese, Brazilian Portuguese is the language used to validate the proposed method. Nevertheless, our proposal may be applied to any other language or domain. Based on the obtained results, the proposed approach showed high-performance overcoming the current baselines for European and Brazilian Portuguese.
研究动机与目标
- 解决巴西社交媒体中仇恨言论和冒犯性内容日益增长的问题,该领域在葡萄牙语研究方面仍显不足。
- 开发一种专为巴西葡萄牙语设计的基于词典的检测系统,该语言在此领域属于低资源语言。
- 通过区分上下文依赖和上下文独立的冒犯性表达,提升检测性能。
- 构建一个可复用的框架,适用于其他语言和葡萄牙语以外的领域。
提出的方法
- 构建一个包含巴西葡萄牙语中显性和隐性冒犯性表达的自定义冒犯性词典。
- 为每个词典条目标注两个二元标签:上下文依赖或上下文独立的冒犯性。
- 将词典集成到一个上下文分类模型中,以评估句子上下文中单词层面的冒犯潜力。
- 利用句子中单词的上下文嵌入,判断某个冒犯性术语在特定上下文中是否可能具有冒犯性。
- 在真实世界中的巴西葡萄牙语社交媒体数据上训练并评估该模型。
- 通过重新应用词典构建和标注流程,将该方法适配到其他语言。
实验结果
研究问题
- RQ1与现有方法相比,基于上下文感知的词典方法是否能提升巴西葡萄牙语中冒犯性语言检测的性能?
- RQ2在提升检测准确率方面,区分上下文依赖与上下文独立冒犯性表达的有效性如何?
- RQ3该方法在巴西葡萄牙语以外的语言或领域中,其泛化能力在多大程度上成立?
- RQ4结合上下文信息是否能显著提升对隐性冒犯性语言的检测?
主要发现
- 所提出的方法在巴西葡萄牙语的冒犯性语言和仇恨言论检测任务中达到了最先进性能。
- 该模型优于现有基线,无论在显性还是隐性冒犯性语言检测中,F1值和精确率均更高。
- 对上下文依赖与上下文独立冒犯性表达的区分显著提升了检测准确率。
- 该方法表现出强大的泛化潜力,表明其可适用于其他具有类似词典适配特性的语言。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。