Skip to main content
QUICK REVIEW

[论文解读] Leveraging cross-platform data to improve automated hate speech detection

John Gallacher|arXiv (Cornell University)|Feb 9, 2021
Hate Speech and Cyberbullying Detection被引用 7
一句话总结

本文提出了一种跨平台仇恨言论检测框架,通过利用来自多个社交媒体平台的多样化数据集和模型,采用超级学习器集成方法以提升泛化能力和性能。通过堆叠泛化有效结合异构训练数据和模型,该方法在未见过的平台上表现出更优的检测准确率,尤其在跨平台场景下表现卓越。

ABSTRACT

Hate speech is increasingly prevalent online, and its negative outcomes include increased prejudice, extremism, and even offline hate crime. Automatic detection of online hate speech can help us to better understand these impacts. However, while the field has recently progressed through advances in natural language processing, challenges still remain. In particular, most existing approaches for hate speech detection focus on a single social media platform in isolation. This limits both the use of these models and their validity, as the nature of language varies from platform to platform. Here we propose a new cross-platform approach to detect hate speech which leverages multiple datasets and classification models from different platforms and trains a superlearner that can combine existing and novel training data to improve detection and increase model applicability. We demonstrate how this approach outperforms existing models, and achieves good performance when tested on messages from novel social media platforms not included in the original training data.

研究动机与目标

  • 解决现有仇恨言论检测模型仅在单一平台进行训练和评估所带来的局限性,从而降低其泛化能力。
  • 通过利用多个社交媒体平台间的多样化语言模式,提升模型的鲁棒性与适用性。
  • 开发一个统一框架,整合来自不同平台的现有与新收集的训练数据,以提升检测性能。
  • 评估模型在先前未见平台上的有效性,确保其在真实世界中可部署,超越原始训练领域。

提出的方法

  • 该方法采用超级学习器集成元学习器,将多个在独立平台数据集上训练的基模型的预测结果进行组合。
  • 每个基模型均在来自单一社交媒体平台的标注仇恨言论数据上进行训练,以捕捉平台特有的语言风格与表达方式。
  • 超级学习器使用堆叠泛化方法,学习最优权重以组合基模型的预测结果,从而提升整体准确率。
  • 该框架整合了来自多样化平台的现有及新收集的训练数据,以增强模型的泛化能力。
  • 通过标准自然语言处理指标(如F1值、精确率和召回率)在多个测试集上评估模型性能。
  • 该方法在跨平台测试数据上进行了验证,包括原始训练数据中未包含的平台的消息。

实验结果

研究问题

  • RQ1在跨平台数据上训练的统一模型是否能优于仅在单一平台训练的基线模型,在仇恨言论检测中表现更优?
  • RQ2超级学习器集成方法在未包含在训练数据中的新社交媒体平台上的泛化能力如何?
  • RQ3在多平台中整合多样化语言模式在多大程度上提升了检测性能?
  • RQ4通过元学习组合多个预训练模型对整体检测准确率有何影响?

主要发现

  • 所提出的跨平台超级学习器模型相比单平台基线模型,在F1值上实现了显著提升,表明检测性能得到增强。
  • 该模型能有效泛化到新平台,在此前未见过的社交媒体平台的测试数据上仍保持高性能。
  • 超级学习器框架优于各个独立的基模型,表明集成学习能有效捕捉不同平台间的互补模式。
  • 异构训练数据的整合使仇恨言论检测更加稳健和适应性强,减少了平台特定偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。