Skip to main content
QUICK REVIEW

[论文解读] Cost-Sensitive BERT for Generalisable Sentence Classification with Imbalanced Data

Harish Tayyar Madabushi, Elena Kochkina|arXiv (Cornell University)|Mar 16, 2020
Topic Modeling参考文献 23被引用 6
一句话总结

该论文提出了一种代价敏感的 BERT 框架,以在数据不平衡和分布偏移的情况下提升句子级宣传语料分类的泛化能力。通过在微调过程中引入代价加权,并提出一种训练集与测试集之间的统计相似性度量,该方法在宣传技巧语料库(Propaganda Techniques Corpus)上取得了第二高的 F1 分数(0.4347),优于标准 BERT 和数据增强技术在不平衡、分布不同的数据上的表现。

ABSTRACT

The automatic identification of propaganda has gained significance in recent years due to technological and social changes in the way news is generated and consumed. That this task can be addressed effectively using BERT, a powerful new architecture which can be fine-tuned for text classification tasks, is not surprising. However, propaganda detection, like other tasks that deal with news documents and other forms of decontextualized social communication (e.g. sentiment analysis), inherently deals with data whose categories are simultaneously imbalanced and dissimilar. We show that BERT, while capable of handling imbalanced classes with no additional data augmentation, does not generalise well when the training and test data are sufficiently dissimilar (as is often the case with news sources, whose topics evolve over time). We show how to address this problem by providing a statistical measure of similarity between datasets and a method of incorporating cost-weighting into BERT when the training and test sets are dissimilar. We test these methods on the Propaganda Techniques Corpus (PTC) and achieve the second-highest score on sentence-level propaganda classification.

研究动机与目标

  • 解决在 NLP 任务中,当训练数据与测试数据不相似时模型泛化能力差的问题,特别是在宣传检测任务中。
  • 在不依赖标准数据增强技术的前提下,提升在类别不平衡数据集上的性能。
  • 开发一种数据集相似性的统计度量方法,以指导在何时应用代价敏感性最为有益。
  • 通过引入类别特定的误分类代价,使 BERT 更好地适应未来演变的数据分布。
  • 发布代码和模型,以支持可复现性以及代价敏感微调的进一步研究。

提出的方法

  • 通过基于类别不平衡和预期误分类代价的类别特定权重,为损失函数分配权重,提出一种代价敏感的 BERT 微调策略。
  • 引入一种统计相似性度量(例如使用分布距离度量)来检测训练集与测试集之间的分布偏移。
  • 在 BERT 微调过程中应用代价加权的交叉熵损失,以更严厉地惩罚对少数类别的误分类。
  • 利用相似性度量决定是否应用代价敏感性,避免在数据分布相似时进行不必要的重加权。
  • 在宣传技巧语料库(PTC)上对句子级和片段级分类任务进行训练与评估。
  • 发布代码和 Colab 笔记本,以支持社区复用和方法的进一步扩展。

实验结果

研究问题

  • RQ1即使存在类别不平衡,标准 BERT 微调在训练数据与测试数据不相似时是否仍表现出较差的泛化能力?
  • RQ2BERT 的代价敏感微调是否能提升在不平衡、分布外测试集上的宣传检测性能?
  • RQ3如何对训练集与测试集之间的数据集相似性进行定量度量,以指导代价敏感性的使用?
  • RQ4数据增强是否能提升 BERT 在不平衡宣传数据集上的性能,还是代价敏感性更为有效?
  • RQ5代价敏感 BERT 是否能在细粒度宣传检测基准上实现最先进性能?

主要发现

  • 标准数据增强技术并未提升 BERT 在不平衡宣传数据集上的性能,表明 BERT 本身对类别不平衡具有较强的鲁棒性。
  • 所提出的代价敏感 BERT 方法在句子级分类任务中取得了第二高的 F1 分数(0.4347),优于基线 BERT 和其他方法。
  • 在片段级分类任务中,该模型取得了第 7 名,F1 分数为 0.098969,表明在处理碎片化宣传线索方面仍有改进空间。
  • 数据集之间的统计相似性度量有助于识别在训练与测试数据在主题或分布上显著不同时,代价敏感性最为有益。
  • 通过参与共享任务验证了该方法的有效性,展示了其在真实场景中的适用性和具有竞争力的性能。
  • 作者发布了代码和 Colab 笔记本,以支持可复现性以及代价敏感 NLP 领域的进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。