Skip to main content
QUICK REVIEW

[论文解读] ToKen: Task Decomposition and Knowledge Infusion for Few-Shot Hate Speech Detection

Badr AlKhamissi, Faisal Ladhak|arXiv (Cornell University)|May 25, 2022
Hate Speech and Cyberbullying Detection被引用 4
一句话总结

本文提出 TOKEN,一种少样本仇恨言论检测方法,通过将任务分解为子任务(冒犯性、目标群体检测)并利用 ATOMIC²⁰ 和 StereoSet 的微调注入常识知识。在 16 个样本的设定下,相比基线模型,F1 值绝对提升 17.83%,且在分布外数据集和训练变化下展现出更强的泛化能力和鲁棒性。

ABSTRACT

Hate speech detection is complex; it relies on commonsense reasoning, knowledge of stereotypes, and an understanding of social nuance that differs from one culture to the next. It is also difficult to collect a large-scale hate speech annotated dataset. In this work, we frame this problem as a few-shot learning task, and show significant gains with decomposing the task into its "constituent" parts. In addition, we see that infusing knowledge from reasoning datasets (e.g. Atomic2020) improves the performance even further. Moreover, we observe that the trained models generalize to out-of-distribution datasets, showing the superiority of task decomposition and knowledge infusion compared to previously used methods. Concretely, our method outperforms the baseline by 17.83% absolute gain in the 16-shot case.

研究动机与目标

  • 为应对少样本仇恨言论检测的挑战,即标注数据稀缺,且模型常难以泛化。
  • 通过将仇恨言论检测分解为可解释的子任务(冒犯性与群体针对性),提升模型性能与鲁棒性。
  • 通过在 ATOMIC²⁰ 和 StereoSet 上进行预微调,注入常识与刻板印象知识,增强模型推理能力。
  • 评估模型在分布外数据集上的泛化能力,以及对数据划分与超参数变化的鲁棒性。
  • 通过隔离子任务中的失败模式并分别改进,实现更具可解释性的系统。

提出的方法

  • 模型将仇恨言论检测分解为两个子任务:判断帖子是否具有冒犯性,以及识别是否存在针对特定群体的意图。
  • 使用 BART-Large 模型在 ATOMIC²⁰ 数据集上进行预微调,以注入常识推理能力;在 StereoSet 上进行微调,以提升对社会刻板印象的理解。
  • 最终模型在 SBIC 数据集上采用条件生成框架进行端到端训练,配备子任务特定的输出头。
  • 性能在 10 个随机种子下进行评估,从 16 到 1024 个样本的少样本训练集采用分层采样。
  • 泛化能力在三个分布外仇恨言论数据集上进行测试,鲁棒性通过种子、数据划分与超参数变化下的方差进行衡量。
  • 该方法通过隔离子任务层面的性能表现,实现模型可解释性,支持针对性改进。

实验结果

研究问题

  • RQ1将任务分解为冒犯性与群体针对性子任务,是否能提升少样本仇恨言论检测的性能?
  • RQ2在推理与刻板印象知识数据集(ATOMIC²⁰ 与 StereoSet)上进行预微调,是否能提升少样本设定下的模型性能?
  • RQ3与端到端二分类基线相比,采用任务分解训练的模型是否在分布外仇恨言论数据集上具有更好的泛化能力?
  • RQ4在使用任务分解与知识注入时,模型性能在不同随机种子、数据划分与超参数下的方差如何变化?
  • RQ5子任务层面的分析是否能识别出失败模式,并指导整体仇恨言论检测性能的针对性改进?

主要发现

  • TOKEN 在 16 个样本设定下相比基线模型实现了 17.83% 的绝对 F1 提升,证明了任务分解与知识注入带来的显著性能增益。
  • 模型在三个分布外仇恨言论数据集上表现出更强的泛化能力,表明其具备更高的鲁棒性与可迁移性。
  • TOKEN 模型在 10 个种子、数据划分与超参数下的性能方差显著降低,展现出更强的鲁棒性。
  • 子任务层面的分析表明,针对特定瓶颈(如群体检测)进行优化,可带来整体模型性能的可测量提升。
  • 在 ATOMIC²⁰ 与 StereoSet 上的微调提升了模型的推理与刻板印象理解能力,直接促进了仇恨言论检测性能的提升。
  • 该方法通过支持在子任务层面进行失败分析,使系统更具可解释性,推动实现可解释且可修复的模型行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。