Skip to main content
QUICK REVIEW

[论文解读] Detecting Harmful Online Conversational Content towards LGBTQIA+ Individuals

Jamell Dacon, Harry Shomer|arXiv (Cornell University)|Jun 15, 2022
Hate Speech and Cyberbullying Detection被引用 4
一句话总结

本文提出了一种用于检测反LGBTQIA+对话内容的新型多标签数据集,采用传统机器学习(SVM、逻辑回归)和微调的大规模语言模型(BERT、RoBERTa、HateBERT)对六种有害语言类别进行分类。结果表明,BERT在大多数标签上的F1得分均达到≥0.82,显示出在识别反LGBTQIA+毒性内容方面的强大性能,尽管在低资源威胁类标签上仍面临挑战。

ABSTRACT

Online discussions, panels, talk page edits, etc., often contain harmful conversational content i.e., hate speech, death threats and offensive language, especially towards certain demographic groups. For example, individuals who identify as members of the LGBTQIA+ community and/or BIPOC (Black, Indigenous, People of Color) are at higher risk for abuse and harassment online. In this work, we first introduce a real-world dataset that will enable us to study and understand harmful online conversational content. Then, we conduct several exploratory data analysis experiments to gain deeper insights from the dataset. We later describe our approach for detecting harmful online Anti-LGBTQIA+ conversational content, and finally, we implement two baseline machine learning models (i.e., Support Vector Machine and Logistic Regression), and fine-tune 3 pre-trained large language models (BERT, RoBERTa, and HateBERT). Our findings verify that large language models can achieve very promising performance on detecting online Anti-LGBTQIA+ conversational content detection tasks.

研究动机与目标

  • 为应对在线对话中反LGBTQIA+仇恨言论、辱骂和攻击性语言日益普遍的问题,特别是在Reddit等平台上的表现。
  • 创建一个高质量的多标签数据集,用于自动检测针对LGBTQIA+个体的六种不同有害语言类别中的有害内容。
  • 评估传统机器学习模型与微调的大规模语言模型在检测反LGBTQIA+对话毒性方面的有效性。
  • 通过支持未来的共享任务和伦理AI在内容审核中的部署,促进构建更安全、更具包容性的在线环境。

提出的方法

  • 借鉴RedditBias中的性别取向维度,分离并标注针对LGBTQIA+个体的六种不同有害语言类别:毒性、严重毒性、粗俗、威胁、侮辱和身份攻击。
  • 通过人工评估标注者,确保在标注敏感、刻板印象和攻击性内容时的数据质量和可靠性。
  • 实施两种基线机器学习模型——支持向量机(SVM)和逻辑回归——用于有害内容的二元和多标签分类。
  • 在数据集上微调三种预训练的大规模语言模型——BERT、RoBERTa和HateBERT——以评估其在检测反LGBTQIA+情感和语言方面的性能。
  • 通过Detoxify自动标注验证和交叉检查人工标注标签,确保数据集内的一致性。
  • 公开发布完整的多标签数据集和代码,以支持未来在反LGBTQIA+内容检测方面的研究和共享任务。

实验结果

研究问题

  • RQ1多标签数据集能否有效捕捉反LGBTQIA+有害语言的细微形式,包括身份攻击、威胁和攻击性刻板印象?
  • RQ2传统机器学习模型与微调的大规模语言模型在检测反LGBTQIA+对话毒性方面表现如何比较?
  • RQ3预训练语言模型如BERT和HateBERT在检测微妙或依赖上下文的反LGBTQIA+蔑称和微侵略行为方面具备多大泛化能力?
  • RQ4由于数据集中类别不平衡,检测低资源标签(如“威胁”)时存在哪些性能权衡?

主要发现

  • BERT在除“威胁”标签外的所有标签上均达到至少0.82的F1得分,表明其在检测反LGBTQIA+有害内容方面表现优异。
  • 尽管HateBERT是专为仇恨言论检测预训练的,但其表现仍逊于BERT,表明通用大规模语言模型在此任务中可能更具有效性。
  • 数据集显示,身份攻击和侮辱是最常见的有害类别,Reddit样本中的毒性评分普遍较高。
  • “威胁”标签样本数量最少,导致所有模型的F1得分最低,凸显类别不平衡是主要挑战。
  • 人工标注标签表现出高度一致性,验证了该数据集在未来共享任务和模型评估中的可靠性。
  • 本研究证实,大规模语言模型可通过有效微调,实现对反LGBTQIA+对话内容的高精度和高召回率检测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。