Skip to main content
QUICK REVIEW

[论文解读] Is More Data Better? Re-thinking the Importance of Efficiency in Abusive Language Detection with Transformers-Based Active Learning

Hannah Rose Kirk, Bertie Vidgen|arXiv (Cornell University)|Sep 21, 2022
Hate Speech and Cyberbullying Detection被引用 7
一句话总结

该论文表明,基于Transformer的主动学习显著提升了有害语言检测中的数据效率,仅使用极少的标注样本即可获得更高的F1分数,甚至在某些情况下超越在完整数据集上训练的全监督模型。通过采用不确定性采样(LeastConfidence)和基于启发式的种子选择方法,该方法将标注需求减少了高达98%,同时保持或提升性能,尤其在低有害内容、类别不平衡的场景下表现更优。

ABSTRACT

Annotating abusive language is expensive, logistically complex and creates a risk of psychological harm. However, most machine learning research has prioritized maximizing effectiveness (i.e., F1 or accuracy score) rather than data efficiency (i.e., minimizing the amount of data that is annotated). In this paper, we use simulated experiments over two datasets at varying percentages of abuse to demonstrate that transformers-based active learning is a promising approach to substantially raise efficiency whilst still maintaining high effectiveness, especially when abusive content is a smaller percentage of the dataset. This approach requires a fraction of labeled data to reach performance equivalent to training over the full dataset.

研究动机与目标

  • 通过提升模型训练的数据效率,解决有害语言标注带来的高成本和心理风险。
  • 探究更多标注数据是否总是能提升性能,或高效主动学习是否能在更少样本下取得更好结果。
  • 评估模型架构(Transformer与传统模型)以及类别不平衡对主动学习效率和效果的影响。
  • 证明基于BERT的主动学习即使仅使用完整数据集的3%,也能在F1分数上超越全监督学习模型。
  • 提供证据表明,主动学习在低有害内容、接近真实世界分布的类别不平衡数据中效益最大。

提出的方法

  • 在两个现有的有害语言数据集(wiki和tweets)上进行模拟主动学习实验,涵盖不同有害内容比例(5%、10%、50%)。
  • 实施四阶段主动学习循环:初始种子选择、用于选择信息样本的查询策略、模拟人工标注、模型重新训练。
  • 比较多种查询策略:LeastConfidence(不确定性)、GreedyCoreSet(多样性)和EmbeddingKMeans(基于嵌入的聚类)。
  • 使用传统SVM和基于BERT的分类器(dBERT)评估模型架构对效率的影响。
  • 采用基于启发式的和随机的种子选择方法,评估初始化对性能的影响,特别是在类别不平衡数据中。
  • 使用F1分数和N90(达到最大F1分数90%所需的标注样本数量)衡量性能,实现跨实验的比较。

实验结果

研究问题

  • RQ1RQ1.1:预训练和模型架构对有害语言检测中主动学习的数据效率和效果有何影响?
  • RQ2RQ1.2:类别不平衡如何影响主动学习策略的效率和效果?
  • RQ3RQ1.3:基于Transformer的主动学习是否能在显著减少标注样本数量的前提下,实现比全监督学习更高的F1分数?
  • RQ4RQ1.4:不同查询策略(如LeastConfidence、GreedyCoreSet、EmbeddingKMeans)在数据效率和性能方面如何比较?
  • RQ5RQ1.5:主动学习模型在不同数据集和不平衡水平下的性能泛化能力如何?

主要发现

  • 当有害内容占比为5%时,仅使用完整数据集3%(600个样本)的基于BERT的主动学习模型,其F1分数比在全部20,000个样本上训练的全监督模型高出5个百分点。
  • LeastConfidence查询策略在数据效率方面优于随机采样和其他基于多样性的策略,达到峰值性能所需的标注样本更少。
  • 较小的种子规模(20个样本)和批量大小(50)相比更大的种子(200)或批量(100、500),显著提升了数据效率,在wiki50上F1分数最高提升达55个百分点。
  • 在类别不平衡数据集中,基于启发式的种子选择至关重要;在wiki10中,随机种子在33%的试验中未能包含有害样本,在wiki5中则100%失败,凸显了明智初始化的必要性。
  • 随着有害内容比例降低,主动学习与随机采样的性能差距扩大,表明主动学习在真实世界、类别不平衡的场景中最具价值。
  • 跨数据集泛化结果显示,从tweets数据集训练的模型在wiki数据集上泛化良好,尤其在低有害内容条件下,表明该主动学习方法具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。