QUICK REVIEW
[论文解读] Multilingual Cross-domain Perspectives on Online Hate Speech
Tom De Smedt, Sylvia Jaki|arXiv (Cornell University)|Sep 11, 2018
Hate Speech and Cyberbullying Detection参考文献 20被引用 9
一句话总结
本文利用自然语言处理技术,对八个不同语料库中的多语言、跨领域仇恨言论进行了分析,识别出圣战主义、极端主义、种族主义和性别歧视内容中共享的修辞模式。通过结合文本分类、关键词与搭配提取以及人工标注,研究揭示了不同语言和领域间一致的语言特征,为多语言环境下的仇恨言论检测提供了一个具有实际应用价值的框架。
ABSTRACT
In this report, we present a study of eight corpora of online hate speech, by demonstrating the NLP techniques that we used to collect and analyze the jihadist, extremist, racist, and sexist content. Analysis of the multilingual corpora shows that the different contexts share certain characteristics in their hateful rhetoric. To expose the main features, we have focused on text classification, text profiling, keyword and collocation extraction, along with manual annotation and qualitative study.
研究动机与目标
- 分析包括圣战主义、极端主义、种族主义和性别歧视内容在内的多语言在线仇恨言论。
- 识别不同语言和仇恨言论类型之间共有的语言与修辞特征。
- 开发并应用自然语言处理技术,以收集、分类和分析多语言语料库中的仇恨言论。
- 通过系统性、跨语言的仇恨言论修辞理解,支持内容审核与政策制定。
提出的方法
- 采用监督和半监督学习方法,对八个多语言语料库中的仇恨言论进行文本分类,以实现分类。
- 运用文本分析技术,分析仇恨言论在不同语言和领域中的风格与结构特征。
- 通过关键词与搭配提取,识别仇恨言论内容中高频且具有语境意义的表达。
- 通过人工标注与定性分析,验证自动化发现,并揭示细微的修辞模式。
- 结合计算与语言学方法,确保研究结果的稳健性与可解释性。
- 采用技术报告格式记录研究发现,重点关注可复现性与实际应用。
实验结果
研究问题
- RQ1在不同领域(如极端主义、种族主义和性别歧视)的多语言仇恨言论中,哪些语言特征是一致存在的?
- RQ2仇恨言论中的修辞模式在不同语言和文化语境中如何变化或保持相似?
- RQ3自然语言处理技术(如文本分类与搭配分析)在多样语料库中检测与分析仇恨言论的效能如何?
- RQ4人工标注在验证与优化自动化仇恨言论检测系统中发挥何种作用?
- RQ5如何系统化地建模跨领域与多语言的仇恨言论检测,以支持现实世界的内容审核?
主要发现
- 研究发现,多语言仇恨言论中存在共享的修辞特征,包括去人性化语言、内群体/外群体对立以及夸张表达。
- 文本分类模型在多种语言中均表现出可靠性能,表明即使在标注数据有限的情况下,仇恨言论模式仍可被检测。
- 关键词与搭配分析揭示了与特定仇恨言论类型相关的重复性短语,例如极端主义内容中的宗教或种族歧视性用语。
- 人工标注证实,自动化方法能够捕捉仇恨言论的核心特征,但对语境敏感表达仍需进一步优化。
- 跨领域分析表明,不同类型的仇恨言论(如种族主义、性别歧视、极端主义)在结构与语言特征上具有共性,暗示可采用统一的检测策略。
- 技术报告框架实现了可复现的分析,并为未来多语言仇恨言论检测系统奠定了基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。