Skip to main content
QUICK REVIEW

[论文解读] Hostility Detection and Covid-19 Fake News Detection in Social Media

Ayush Gupta, Rohan Sukumaran|arXiv (Cornell University)|Jan 15, 2021
Hate Speech and Cyberbullying Detection参考文献 24被引用 19
一句话总结

本文提出了一种集成模型,用于检测印地语(天城文)和英文社交媒体内容中的敌意行为与虚假新闻,结合了印地语 BERT、FastText、仇恨语言检测和元数据特征。该模型在粗粒度敌意检测中取得了 0.97 的 F1 分数,在英文虚假新闻检测中取得了 0.93 的 F1 分数,通过利用轻量级嵌入和实体感知特征,优于更大的 BERT 基础模型。

ABSTRACT

Withtheadventofsocialmedia,therehasbeenanextremely rapid increase in the content shared online. Consequently, the propagation of fake news and hostile messages on social media platforms has also skyrocketed. In this paper, we address the problem of detecting hostile and fake content in the Devanagari (Hindi) script as a multi-class, multi-label problem. Using NLP techniques, we build a model that makes use of an abusive language detector coupled with features extracted via Hindi BERT and Hindi FastText models and metadata. Our model achieves a 0.97 F1 score on coarse grain evaluation on Hostility detection task. Additionally, we built models to identify fake news related to Covid-19 in English tweets. We leverage entity information extracted from the tweets along with textual representations learned from word embeddings and achieve a 0.93 F1 score on the English fake news detection task.

研究动机与目标

  • 为应对社交媒体中日益严重的敌意与虚假内容问题,特别是针对印地语等低资源语言。
  • 通过混合 NLP 技术,提升在天城文(印地语)和英文推文中文本的虚假新闻与敌意检测准确性。
  • 评估语言特征、元数据和实体信息对模型性能的影响。
  • 探索弱监督潜力,通过识别英文虚假新闻数据集中标注错误的样本。

提出的方法

  • 模型使用 FastText 和印地语 BERT 嵌入的轻量级集成进行印地语文本的表征学习。
  • 引入包括 URL、提及、话题标签和表情符号数量在内的元数据特征,以增强分类性能。
  • 使用仇恨语言检测器作为特征,以提升对攻击性与仇恨言论的检测能力。
  • 对于英文虚假新闻,模型通过 BoW(词袋)方法结合 Word2Vec 嵌入、实体信息和元数据。
  • 最终的集成模型整合了多种基础模型,包括 LSTM 和全连接层,以提升泛化能力。
  • 通过消融研究测量每类特征(语言特征、元数据、基于实体的特征)的贡献。

实验结果

研究问题

  • RQ1轻量级词嵌入结合元数据和基于实体的特征,是否能在虚假新闻检测中超越更大的预训练模型(如 BERT)?
  • RQ2多语言和语言特定的 BERT 模型在检测低资源语言(如印地语)中的敌意行为方面效果如何?
  • RQ3元数据和仇恨语言特征在多大程度上提升了敌意检测模型的性能?
  • RQ4模型能否识别并修正英文虚假新闻数据集中标注错误的样本,从而为未来数据整理提供弱监督潜力?
  • RQ5在多类别、多标签的敌意检测中,不同特征类型(语言、元数据、实体)的相对贡献如何?

主要发现

  • 集成模型在印地语粗粒度敌意检测中取得了 0.97 的加权 F1 分数,在共享任务中位列 45 支队伍中的第 5 名。
  • 在细粒度分类中,模型取得了 0.62 的加权 F1 分数,位列 45 支队伍中的第 7 名。
  • 元数据特征(URL、提及、话题标签、表情符号数量)的引入使细粒度分类的 F1 分数最高提升了 7%。
  • 在英文虚假新闻任务中,该模型优于更大的 BERT 基础模型,使用轻量级 FastText-LSTM 集成在测试数据上取得了 0.95 的 F1 分数。
  • 实体信息和元数据的引入显著提升了性能,最佳模型在英文虚假新闻检测中达到了 0.97 的 F1 分数。
  • 模型成功识别出英文虚假新闻数据集中多个标注错误的样本,表明其在未来的弱监督数据整理中具有潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。