[论文解读] How Hateful are Movies? A Study and Prediction on Movie Subtitles
本研究提出了一项新型数据集,包含11,000条电影字幕,已标注为仇恨言论、冒犯性言论或正常言论,并评估了从社交媒体(Twitter、Fox News)迁移学习在电影对白中检测仇恨和冒犯性内容的效果。通过在电影字幕上微调BERT模型,模型实现了77%的宏平均F1得分,表明尽管存在语境和语言差异,迁移学习仍能有效将社交媒体仇恨言论检测模型适配至电影字幕。
In this research, we investigate techniques to detect hate speech in movies. We introduce a new dataset collected from the subtitles of six movies, where each utterance is annotated either as hate, offensive or normal. We apply transfer learning techniques of domain adaptation and fine-tuning on existing social media datasets, namely from Twitter and Fox News. We evaluate different representations, i.e., Bag of Words (BoW), Bi-directional Long short-term memory (Bi-LSTM), and Bidirectional Encoder Representations from Transformers (BERT) on 11k movie subtitles. The BERT model obtained the best macro-averaged F1-score of 77%. Hence, we show that transfer learning from the social media domain is efficacious in classifying hate and offensive speech in movies through subtitles.
研究动机与目标
- 探究现有社交媒体仇恨言论检测模型在应用于电影字幕时的局限性。
- 开发并评估一种基于迁移学习的分类模型,用于检测电影字幕中的仇恨和冒犯性言论。
- 创建一个包含11,000条电影字幕语句的新公开数据集,标注为仇恨、冒犯或正常内容。
- 探究不同NLP架构(词袋模型、Bi-LSTM和BERT)在电影对白中分类仇恨和冒犯性言论的有效性。
- 发布数据集、微调后的模型和代码,以支持未来在媒体相关仇恨言论检测领域的研究。
提出的方法
- 标注者使用基于批次、上下文感知的标注流程,将六部电影中的11,000条电影字幕语句标注为三类:仇恨、冒犯或正常。
- 本研究采用迁移学习方法,通过领域自适应和微调,利用来自Twitter和Fox News数据集的预训练模型,以提升在电影字幕上的性能。
- 评估了三种模型:词袋模型基线、Bi-LSTM以捕捉对话的序列模式,以及BERT模型以实现上下文表征学习。
- 使用k折交叉验证对BERT模型在电影字幕数据集上进行微调,以确保稳健评估并避免数据泄露。
- 开发了一种技术,将字幕片段组合,以更好地对齐社交媒体文本与电影对白的结构,从而提升迁移学习效果。
- 所有模型均使用宏平均F1得分进行评估,并对标注分歧和模型预测结果进行了定性分析。
实验结果
研究问题
- RQ1当将社交媒体仇恨言论检测模型应用于电影字幕时,其存在哪些局限性?
- RQ2从社交媒体和新闻领域迁移学习在电影字幕中分类仇恨和冒犯性言论方面的有效性如何?
- RQ3在电影字幕仇恨言论检测中,哪种NLP模型架构——词袋模型、Bi-LSTM或BERT——表现最佳?
- RQ4标注不一致性和语境缺失如何影响电影对白中仇恨言论检测的可靠性?
- RQ5微调后的BERT模型是否能在不打乱数据的情况下泛化到新的、未见过的电影中,从而保持真实世界部署的现实性?
主要发现
- BERT模型实现了77%的最高宏平均F1得分,显著优于词袋模型和Bi-LSTM基线模型,在区分仇恨与冒犯性言论方面表现更优。
- 研究发现,被标记为种族主义或仇恨的电影(如《被劫持的奴役》和《黑色党徒》)含有最高比例的仇恨言论,而以友谊为主题的电影(如《华尔街之狼》)尽管仇恨内容较少,却表现出更高的冒犯性言论比例。
- 标注分歧较为常见,尤其是在涉及“nigger”和“shit”等辱骂性词汇时,语境和说话者意图对分类结果影响极大,凸显了仇恨言论检测的主观性。
- 所有模型在“正常”类别上的表现最强,表明区分“冒犯性”与“仇恨”言论仍是重大挑战。
- 在电影字幕上微调BERT显著提升了性能,优于领域自适应模型,表明在领域内数据上进行微调对实现高精度至关重要。
- 研究人员已发布完整数据集、模型和代码,以支持可复现性及未来在媒体相关仇恨言论检测领域的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。