Skip to main content
QUICK REVIEW

[论文解读] Fine-Tuning Pre-trained Language Model with Weak Supervision: A Contrastive-Regularized Self-Training Approach

Yue Yu, Simiao Zuo|arXiv (Cornell University)|Oct 15, 2020
Topic Modeling参考文献 44被引用 5
一句话总结

本文提出COSINE,一种对比正则化的自训练框架,仅使用弱监督对预训练语言模型进行微调,无需任何标注数据。通过结合对比正则化以提升表征学习能力,以及基于置信度的重加权以抑制噪声伪标签,COSINE在Yelp数据集上实现了96.0%的准确率,与完全监督微调方法的97.2%准确率相比表现相当,性能具有竞争力。

ABSTRACT

Fine-tuned pre-trained language models (LMs) have achieved enormous success in many natural language processing (NLP) tasks, but they still require excessive labeled data in the fine-tuning stage. We study the problem of fine-tuning pre-trained LMs using only weak supervision, without any labeled data. This problem is challenging because the high capacity of LMs makes them prone to overfitting the noisy labels generated by weak supervision. To address this problem, we develop a contrastive self-training framework, COSINE, to enable fine-tuning LMs with weak supervision. Underpinned by contrastive regularization and confidence-based reweighting, this contrastive self-training framework can gradually improve model fitting while effectively suppressing error propagation. Experiments on sequence, token, and sentence pair classification tasks show that our model outperforms the strongest baseline by large margins on 7 benchmarks in 6 tasks, and achieves competitive performance with fully-supervised fine-tuning methods.

研究动机与目标

  • 解决在标注数据稀缺或不可用时微调预训练语言模型的挑战。
  • 缓解自训练过程中由弱监督生成的噪声伪标签导致的误差传播问题。
  • 通过利用对比正则化和基于置信度的重加权,提升弱监督下的模型泛化能力和鲁棒性。
  • 开发一种灵活、任务无关的框架,适用于多种NLP分类任务,且无需事先了解弱监督来源。
  • 在仅依赖弱标注数据和未标注数据的前提下,实现与完全监督微调相当的性能。

提出的方法

  • COSINE采用两阶段训练流程:首先在弱标注数据上对模型进行微调,并应用早停策略。
  • 随后在未标注数据上应用对比自训练,其中生成伪标签,并通过拉近同类别样本、推开不同类别样本的方式对特征空间进行正则化。
  • 基于置信度的重加权在训练过程中强调高置信度预测,以减少错误伪标签的影响。
  • 置信度正则化通过抑制过度自信的预测来增强模型平滑性,从而降低对噪声标签的敏感性。
  • 当存在少量干净标签时,该框架可扩展至半监督学习。
  • 该方法对弱监督来源无感,支持语义规则、模式匹配和众包标签等多种方式。

实验结果

研究问题

  • RQ1在弱监督下,对比自训练框架能否有效降低预训练语言模型微调过程中的标签噪声?
  • RQ2基于置信度的重加权与正则化在自训练中如何提升对噪声伪标签的鲁棒性?
  • RQ3弱监督模型在多大程度上可实现与完全监督微调相当的性能?
  • RQ4该框架能否在包括序列、词级别和句子对分类在内的多种NLP任务中实现泛化?
  • RQ5在不同类型的标签噪声(如偏差性或随机损坏的标签)下,模型表现如何?

主要发现

  • 在七个公开基准数据集上评估的六个NLP分类任务中,COSINE在所有任务上均优于最强基线模型。
  • 在Yelp数据集上,COSINE达到96.0%的准确率,与完全监督微调的97.2%准确率非常接近。
  • 得益于对比正则化和基于置信度的重加权,该模型对偏差性和随机损坏的标签噪声均表现出强鲁棒性。
  • 即使在完全没有标注数据的情况下,该框架仍能实现具有竞争力的性能,显著优于现有弱监督微调方法。
  • 基于置信度的重加权与正则化能有效抑制误差传播,防止迭代自训练过程中的性能下降。
  • 该方法具有高度灵活性,可适用于多种弱监督来源(如语义规则和众包标签),且无需事先了解标注函数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。