Skip to main content
QUICK REVIEW

[论文解读] Cold-Start Data Selection for Few-shot Language Model Fine-tuning: A Prompt-Based Uncertainty Propagation Approach

Yue Yu, Rongzhi Zhang|arXiv (Cornell University)|Sep 15, 2022
Topic Modeling被引用 7
一句话总结

本文提出 Patron,一种基于提示的少样本微调数据选择方法,适用于冷启动场景(即无任何标注数据)。该方法利用基于提示的不确定性传播来估计样本重要性,并采用分而再写(partition-then-rewrite)策略以确保多样性,在仅使用128个标注样本的情况下,性能达到完全监督方法的92.1%,准确率最高比基线方法高出6.9%。

ABSTRACT

Large Language Models have demonstrated remarkable few-shot performance, but the performance can be sensitive to the selection of few-shot instances. We propose PATRON, a new method that uses prompt-based uncertainty estimation for data selection for pre-trained language model fine-tuning under cold-start scenarios, i.e., no initial labeled data are available. In PATRON, we design (1) a prompt-based uncertainty propagation approach to estimate the importance of data points and (2) a partition-then-rewrite (PTR) strategy to promote sample diversity when querying for annotations. Experiments on six text classification datasets show that PATRON outperforms the strongest cold-start data selection baselines by up to 6.9%. Besides, with 128 labels only, PATRON achieves 91.0% and 92.1% of the fully supervised performance based on vanilla fine-tuning and prompt-based learning respectively. Our implementation of PATRON is available at \url{https://github.com/yueyu1030/Patron}.

研究动机与目标

  • 解决在无任何标注数据可用的情况下,为预训练语言模型的少样本微调选择高质量训练数据的挑战。
  • 通过改进冷启动条件下的数据选择策略,降低低数据场景下的性能波动。
  • 在不依赖初始标注数据或基于梯度的不确定性的情况下,提升数据选择中样本的多样性与代表性。
  • 通过基于提示的伪标签生成与不确定性传播,弥合预训练与微调任务之间的差距。
  • 开发一种对超参数不敏感、鲁棒性强的方法,在低预算设置下优于现有冷启动数据选择基线方法。

提出的方法

  • 使用提示模板与词元化器将分类任务转化为填空式任务,通过掩码语言建模生成任务感知的伪标签。
  • 在嵌入空间中应用基于核的相似性度量,以衡量样本相关性,并将预测不确定性传播至邻近样本。
  • 引入不确定性传播机制,识别模型不确定性较高的区域,即样本及其邻居均不确定的区域,表明其具有较高的数据效用。
  • 采用两阶段分而再写(PTR)策略:首先使用 K-Means 对数据进行聚类,然后利用基于 kNN 的邻居图与距离正则化对所选样本进行优化。
  • 引入 SimCSE 嵌入以提升语义表示质量,并缓解 RoBERTa 模型嵌入中的退化问题。
  • 在 PTR 中引入正则化项,防止每个簇内所选样本之间过于接近,从而确保多样性。

实验结果

研究问题

  • RQ1在无任何标注数据的冷启动场景下,基于提示的伪标签能否提升数据选择性能?
  • RQ2在缺乏真实标签的情况下,如何可靠地估计并传播不确定性以支持少样本微调?
  • RQ3分而再写策略是否能在不依赖梯度或模型更新信号的情况下,有效提升样本多样性?
  • RQ4将基于提示的不确定性与基于嵌入的相似性相结合,能在多大程度上提升数据选择性能?
  • RQ5在低标注预算下,所提出方法对超参数选择的鲁棒性如何?

主要发现

  • Patron 在六个文本分类数据集上,性能最高比最先进冷启动数据选择基线高出6.9%。
  • 仅使用128个标注样本,Patron 达到了完全监督微调性能的91.0%,以及完全监督提示学习性能的92.1%。
  • 使用 SimCSE 嵌入显著提升了性能,有效缓解了基于 RoBERTa 模型的嵌入退化问题。
  • 不确定性传播通过识别高模型不确定性区域,提升了数据效用估计,其选择效果优于基线不确定性方法。
  • PTR 策略有效控制了样本间距离,提升了多样性,并对整体性能提升有显著贡献。
  • Patron 对超参数设置具有鲁棒性,其性能在不同 ρ、β 和 γ 值下保持稳定,最优值通过迭代调优获得。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。