[论文解读] Better Fine-Tuning by Reducing Representational Collapse
本文提出了R3F和R4F,这两种基于信任域理论的高效微调方法通过在训练过程中引入参数化噪声,有效缓解了表征崩溃问题。该方法在GLUE、XNLI、文本摘要和文本生成任务上均优于标准微调和对抗性微调方法,同时保持了可泛化的表征,并显著降低了计算开销。
Although widely adopted, existing approaches for fine-tuning pre-trained language models have been shown to be unstable across hyper-parameter settings, motivating recent work on trust region methods. In this paper, we present a simplified and efficient method rooted in trust region theory that replaces previously used adversarial objectives with parametric noise (sampling from either a normal or uniform distribution), thereby discouraging representation change during fine-tuning when possible without hurting performance. We also introduce a new analysis to motivate the use of trust region methods more generally, by studying representational collapse; the degradation of generalizable representations from pre-trained models as they are fine-tuned for a specific end task. Extensive experiments show that our fine-tuning method matches or exceeds the performance of previous trust region methods on a range of understanding and generation tasks (including DailyMail/CNN, Gigaword, Reddit TIFU, and the GLUE benchmark), while also being much faster. We also show that it is less prone to representation collapse; the pre-trained models maintain more generalizable representations every time they are fine-tuned.
研究动机与目标
- 为解决预训练语言模型标准微调中的不稳定性和泛化能力差的问题。
- 探究微调过程中表征崩溃现象,即预训练模型中的可泛化特征在适应过程中退化。
- 开发一种计算效率更高的对抗性信任域方法替代品,如SMART和FreeLB。
- 证明减少表征崩溃可提升在多种自然语言处理任务上的零样本和少样本泛化能力。
提出的方法
- 该方法在微调过程中对预训练模型的表征应用参数化噪声(正态或均匀分布),起到正则化作用。
- 通过约束表征分布的变化来近似信任域优化,避免导致崩溃的大规模参数更新。
- 与需要多次前向传播的对抗性方法不同,该方法每轮更新仅需一次反向传播,显著降低了内存和计算成本。
- 将微调建模为一个约束优化问题,其边界由表征密度之间的KL散度定义,并通过噪声注入进行近似。
- 该方法实现为R3F(带残差连接)和R4F(额外引入归一化),两者均设计为高效且稳定。
- 通过探针实验测量表征质量和崩溃程度,方法为在微调后对冻结表征训练线性分类头。
实验结果
研究问题
- RQ1标准微调是否会导致表征崩溃,即预训练模型中的可泛化特征在适应过程中退化?
- RQ2基于信任域的方法是否比标准微调更有效地缓解表征崩溃?
- RQ3是否存在一种比现有对抗性微调方法更简单、更高效的替代方案,可在降低计算成本的同时实现相当或更优的性能?
- RQ4R3F和R4F在顺序和循环任务微调中,能在多大程度上保持表征质量?
- RQ5减少表征崩溃是否与下游任务上零样本和少样本泛化能力的提升相关?
主要发现
- R3F和R4F在所有评估的GLUE任务上均优于标准微调和对抗性方法(如SMART),在RoBERTa模型上刷新了GLUE的最先进性能记录。
- 在零样本XNLI任务上,该方法无需额外预训练即达到最先进性能,证明了其跨语言泛化能力的提升。
- 在摘要生成任务(DailyMail/CNN、Gigaword、Reddit TIFU)上,R3F和R4F持续优于标准微调,取得了新的SOTA结果。
- 探针实验表明,与标准微调相比,R3F和R4F保持了更高品质的表征,且在顺序任务微调中表征退化程度显著降低。
- 循环探针实验显示,R4F在多次微调循环中仍能保持表征质量,而标准微调则表现出性能逐步下降。
- 与SMART相比,该方法更有效地减少了表征崩溃,且与在多种自然语言处理任务中提升的泛化能力和鲁棒性密切相关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。