[论文解读] Leveraging Intra-User and Inter-User Representation Learning for Automated Hate Speech Detection
该论文提出了一种新颖的深度学习框架,通过联合利用用户内部(用户历史推文)和用户之间(其他用户中语义相似的推文)的表征学习,提升了Twitter上仇恨言论检测的性能。通过使用强化双向LSTM动态选择相关的用户间推文,并将其与用户特定的表征相结合,该模型使强基线双向LSTM的F1分数提升了10.1%,显著降低了在嘈杂、短文本社交媒体内容中的误报和漏报率。
Hate speech detection is a critical, yet challenging problem in Natural Language Processing (NLP). Despite the existence of numerous studies dedicated to the development of NLP hate speech detection approaches, the accuracy is still poor. The central problem is that social media posts are short and noisy, and most existing hate speech detection solutions take each post as an isolated input instance, which is likely to yield high false positive and negative rates. In this paper, we radically improve automated hate speech detection by presenting a novel model that leverages intra-user and inter-user representation learning for robust hate speech detection on Twitter. In addition to the target Tweet, we collect and analyze the user's historical posts to model intra-user Tweet representations. To suppress the noise in a single Tweet, we also model the similar Tweets posted by all other users with reinforced inter-user representation learning techniques. Experimentally, we show that leveraging these two representations can significantly improve the f-score of a strong bidirectional LSTM baseline model by 10.1%.
研究动机与目标
- 为解决现有仇恨言论检测模型中较高的误报率和漏报率问题,这些模型通常将每条推文孤立处理。
- 通过建模用户历史推文序列中的用户特异性语言模式(用户内部表征),提升检测的鲁棒性。
- 通过引入其他用户中语义相似的推文(用户之间表征),利用强化学习智能体减少单条推文中的噪声。
- 将目标推文、用户内部表征和用户之间表征整合到统一的深度学习框架中,以提升分类性能。
- 证明无监督的用户历史数据和大规模未标注推文语料库可显著提升仇恨言论检测效果,而无需人工标注。
提出的方法
- 该模型使用双向LSTM(Bi-LSTM)作为基线,将目标推文编码为表征。
- 用户内部表征通过使用相同的Bi-LSTM架构编码目标用户最多400条历史推文,再通过加权求和进行聚合来学习。
- 用户之间表征通过使用局部敏感哈希(LSH)从其他用户中选择语义相似的推文,再通过独立的Bi-LSTM进行处理。
- 策略梯度智能体逐次从候选集中选择一条用户之间推文,利用强化学习框架随时间提升表征质量。
- 最终预测通过共享分类器头将目标推文表征、用户内部表征和强化后的用户之间表征进行组合生成。
- 模型使用Adam优化器进行端到端训练,词嵌入在大规模Twitter语料库上预训练。
实验结果
研究问题
- RQ1与孤立处理每条推文相比,建模用户历史推文序列是否能提升仇恨言论检测性能?
- RQ2将其他用户中语义相似的推文纳入是否能增强对嘈杂或模糊的单条推文的鲁棒性?
- RQ3通过强化学习智能体动态选择用户之间推文是否能优于随机选择或固定聚合方式,从而提升检测准确率?
- RQ4结合用户内部与用户之间表征在多大程度上能降低仇恨言论检测中的误报率和漏报率?
- RQ5该框架在存在用户历史或大规模未标注语料库的其他文本分类任务中是否具有可扩展性?
主要发现
- 通过整合用户内部表征与强化后的用户之间表征,所提模型使强基线双向LSTM的F1分数提升了10.1%。
- 仅使用用户内部表征即可降低误报率,因其能捕捉用户特异性的语言模式与上下文。
- 与随机选择相比,使用强化学习智能体进行用户之间推文选择带来了微小但统计显著的性能提升(p < 0.01)。
- 该模型在精确率、召回率和F1分数等指标上显著优于多个强基线模型,包括SVM、逻辑回归、CNN和注意力机制双向LSTM。
- 错误分析显示,罕见缩写以及讽刺或隐喻性语言仍是挑战,尤其当目标推文与用户之间表征均不可靠时。
- 该框架具备可扩展性,可推广至涉及用户历史或大规模未标注文本数据的其他NLP任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。