[论文解读] Calibrated Language Model Fine-Tuning for In- and Out-of-Distribution Data
本文提出了一种用于微调预训练语言模型的正则化方法,通过引入两种新型正则化项,提升了模型在分布内(in-distribution)和分布外(OOD)数据上的校准性能:通过隐藏特征空间插值实现的流形内正则化,以增强分布内平滑性;通过大扰动样本实现的流形外正则化,以降低分布外预测的过度自信。该方法显著降低了期望校准误差(ECE),并在六个数据集上提升了分布外检测性能。
Fine-tuned pre-trained language models can suffer from severe miscalibration for both in-distribution and out-of-distribution (OOD) data due to over-parameterization. To mitigate this issue, we propose a regularized fine-tuning method. Our method introduces two types of regularization for better calibration: (1) On-manifold regularization, which generates pseudo on-manifold samples through interpolation within the data manifold. Augmented training with these pseudo samples imposes a smoothness regularization to improve in-distribution calibration. (2) Off-manifold regularization, which encourages the model to output uniform distributions for pseudo off-manifold samples to address the over-confidence issue for OOD data. Our experiments demonstrate that the proposed method outperforms existing calibration methods for text classification in terms of expectation calibration error, misclassification detection, and OOD detection on six datasets. Our code can be found at https://github.com/Lingkai-Kong/Calibrated-BERT-Fine-Tuning.
研究动机与目标
- 解决微调后的预训练语言模型在分布内和分布外数据上严重的校准偏差问题。
- 通过确保预测概率准确反映分布内输入的真实可能性,提升模型的可靠性。
- 通过鼓励输出分布趋于均匀,降低模型对分布外输入的过度自信。
- 通过基于数据增强的正则化缓解过拟合,提升泛化能力。
- 提供一种可扩展的训练时解决方案,其性能优于事后校准和贝叶斯方法。
提出的方法
- 通过在训练数据的隐藏特征空间中进行线性插值,生成伪样本,引入流形内正则化。
- 利用这些插值样本,在数据流形内部对模型的决策边界施加平滑性约束。
- 通过生成远离数据流形的对抗性类似扰动,实施流形外正则化,以促使模型对分布外输入输出均匀的概率分布。
- 通过联合目标函数优化模型,结合交叉熵损失与两种正则化项,以平衡分布内和分布外的校准性能。
- 采用两阶段优化流程:首先求解内层极小化-极大化问题以生成鲁棒的伪样本,随后使用正则化损失进行标准微调。
- 联合调优两种正则化的超参数,以确保其在提升校准性能方面产生互补效应。
实验结果
研究问题
- RQ1通过流形内插值进行数据增强,能否改善微调语言模型在分布内数据上的校准性能?
- RQ2流形外正则化能否有效降低模型对分布外输入预测的过度自信?
- RQ3同时使用两种正则化是否能带来优于单一正则化或基线方法的整体校准性能?
- RQ4流形内与流形外正则化的超参数之间如何相互作用?是否需要联合调优?
- RQ5该方法是否能在不增加推理成本的前提下,实现分布内校准和分布外检测的最先进性能?
主要发现
- 与 BERT 基线相比,该方法在 20NG 15 数据集上将期望校准误差(ECE)降低了高达 60%,从 9.24% 降至 3.69%。
- 在 20NG 数据集上,结合两种正则化后,分布外检测 AUC 从 BERT 的 21.65% 提升至 63.92%,展现出强大的分布外泛化能力。
- 若移除流形外正则化,分布外 AUC 下降 20.05%(从 63.92% 降至 43.87%),证明其在分布外校准中的关键作用。
- 仅使用流形内正则化时,20NG 数据集上的 ECE 降低至 5.00%,表明其在提升分布内校准方面的有效性。
- 联合调优两种正则化至关重要,消融实验表明,当组件被移除或独立调优时,性能显著下降。
- 在六个不同文本分类数据集上,该方法在 ECE 和分布外检测性能上均优于现有校准基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。