[论文解读] Data-Efficient Strategies for Expanding Hate Speech Detection into Under-Resourced Languages
本文提出了一种数据高效的方法,用于在资源匮乏的语言中部署仇恨言论检测模型,仅需极少的目标语言微调数据,并利用现成的英语数据进行初始预训练。研究发现,仅需少量目标语言数据即可实现优异性能,超过该阈值后收益递减;且初始英语微调可提升模型泛化能力,从而在降低标注成本与风险的前提下实现高效的低资源部署。
Hate speech is a global phenomenon, but most hate speech datasets so far focus on English-language content. This hinders the development of more effective hate speech detection models in hundreds of languages spoken by billions across the world. More data is needed, but annotating hateful content is expensive, time-consuming and potentially harmful to annotators. To mitigate these issues, we explore data-efficient strategies for expanding hate speech detection into under-resourced languages. In a series of experiments with mono- and multilingual models across five non-English languages, we find that 1) a small amount of target-language fine-tuning data is needed to achieve strong performance, 2) the benefits of using more such data decrease exponentially, and 3) initial fine-tuning on readily-available English data can partially substitute target-language data and improve model generalisability. Based on these findings, we formulate actionable recommendations for hate speech detection in low-resource language settings.
研究动机与目标
- 通过在标注数据有限的资源匮乏语言中实现有效模型,解决全球仇恨言论检测的不平衡问题。
- 通过最小化所需的目标语言标注工作量,降低标注仇恨内容的成本与风险。
- 探究在低资源环境下,初始在高资源英语数据上微调在在多大程度上可替代目标语言数据。
- 为在低资源语言环境中部署仇恨言论检测系统,提出可操作的、基于证据的建议。
提出的方法
- 在五种非英语语言(阿拉伯语、西班牙语、印地语、葡萄牙语和意大利语)中,对单语和多语言Transformer模型进行微调,使用不同大小的随机仇恨言论数据样本。
- 采用两阶段微调流程:首先在英语数据上微调(可选),然后在逐步增大的目标语言数据样本上微调。
- 使用多语言仇恨检测基准(Multilingual HateCheck, MHC)作为保留测试集,评估零样本和少样本性能。
- 通过目标语言数据集的保留测试集和MHC评估模型性能,测量准确率和泛化能力。
- 每种语言和模型类型使用10个随机种子以确保鲁棒性,共训练3,000个模型,覆盖5种语言和5种模型类型。
- 从 hatespeechdata.com 选取与西方法律定义的仇恨言论一致、针对受保护群体的语料。
实验结果
研究问题
- RQ1在低资源语言中实现优异仇恨言论检测性能,需要多少目标语言微调数据?
- RQ2随着目标语言数据增加,性能提升是否呈现收益递减规律?
- RQ3在低资源环境下,初始在英语数据上微调在多大程度上可替代目标语言数据以提升模型泛化能力?
- RQ4初始英语微调在多大程度上影响模型在不同语言中的鲁棒性和分布外性能?
- RQ5在最小化标注负担的前提下,部署仇恨言论检测系统的最有效、低成本策略是什么?
主要发现
- 仅需少量目标语言微调数据(如100至500个样本)即可在所有五种非英语语言中实现对保留测试集的优异性能。
- 随着目标语言数据增加,性能提升呈指数下降趋势,表明在小样本阈值后边际改进迅速减少。
- 在现成英语数据上进行初始微调可显著提升模型泛化能力,可在目标数据稀缺时部分替代目标语言数据。
- 多语言模型(如XLM-T)从初始英语微调中受益,表现出在目标语言上的改进零样本迁移性能。
- 分布外评估表明,仅在目标数据上微调的模型可能缺乏鲁棒性,凸显了多样化数据收集和在高资源语言上进行初始预训练的必要性。
- 由于使用小样本数据和在CPU上高效计算,微调的环境成本极低,表明其具有低资源开销的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。