[论文解读] A Kernel-Based View of Language Model Fine-Tuning
本文提出了一种基于核函数的框架,从理论上解释了微调大规模语言模型(LMs)成功的原因,表明在Adam优化器下使用提示(prompt)进行微调时,其训练动态通常符合神经正切核(NTK)行为。论文证明了提示能够诱导类似核函数的优化过程,并展示了参数高效方法(如LoRA)能够保持核结构,从而解释了其在极小参数更新下依然有效的机制。
It has become standard to solve NLP tasks by fine-tuning pre-trained language models (LMs), especially in low-data settings. There is minimal theoretical understanding of empirical success, e.g., why fine-tuning a model with $10^8$ or more parameters on a couple dozen training points does not result in overfitting. We investigate whether the Neural Tangent Kernel (NTK) - which originated as a model to study the gradient descent dynamics of infinitely wide networks with suitable random initialization - describes fine-tuning of pre-trained LMs. This study was inspired by the decent performance of NTK for computer vision tasks (Wei et al., 2022). We extend the NTK formalism to Adam and use Tensor Programs (Yang, 2020) to characterize conditions under which the NTK lens may describe fine-tuning updates to pre-trained language models. Extensive experiments on 14 NLP tasks validate our theory and show that formulating the downstream task as a masked word prediction problem through prompting often induces kernel-based dynamics during fine-tuning. Finally, we use this kernel view to propose an explanation for the success of parameter-efficient subspace-based fine-tuning methods.
研究动机与目标
- 理解为何在少量样本数据上微调大规模语言模型不会发生过拟合,尽管其模型容量很高。
- 解释提示在微调中取得经验成功的原因,特别是其在诱导类似核函数的优化动态中的作用。
- 将神经正切核(NTK)框架理论上扩展至Adam优化和非随机(预训练)权重初始化。
- 通过分析其核函数行为,为参数高效微调方法(如LoRA)提供理论基础。
- 在14项多样化的自然语言处理任务中,通过实证验证核函数视角,以识别核函数动态出现的条件。
提出的方法
- 通过引入基于梯度符号的核函数公式,将标准NTK形式化扩展至Adam优化,以建模训练初期的动态行为。
- 利用Tensor Programs框架分析具有预训练、非独立同分布初始化的无限宽度网络,从而实现对非随机权重初始化下微调的理论分析。
- 使用预训练模型参数的梯度定义一个经验NTK(eNTK),以表示微调过程中的核函数动态。
- 通过在无限宽度极限下分析梯度动态,正式证明基于提示的微调在Transformer中诱导出核函数行为。
- 应用Johnson-Lindenstrauss引理,证明低秩参数更新(如LoRA)以高概率保持核结构。
- 推导出LoRA中由SGD诱导的核函数的闭式表达式,并与全量微调的核函数进行比较,证明在弱假设下二者具有高度相似性。
实验结果
研究问题
- RQ1在何种条件下,预训练语言模型的微调会表现出基于核函数的动力学,特别是当采用Adam优化时?
- RQ2提示在大规模模型微调过程中如何影响核函数行为的出现?
- RQ3参数高效微调方法(如LoRA)的成功能否通过核函数视角加以解释?
- RQ4经验NTK在多样的自然语言处理任务中,能在多大程度上准确描述微调动态?
- RQ5LoRA的梯度动态与全量微调相比,在核函数相似性方面表现如何?
主要发现
- 基于提示的微调始终能诱导出类似核函数的动力学,这在14项自然语言处理任务中均得到eNTK预测与实际微调性能高度一致的验证。
- eNTK在图像任务上的分类准确率可达到全量微调的94%以内(来自先前工作),而该核函数行为在自然语言模型中也得以复现,验证了其在语言模型中的泛化能力。
- 在满足 $k \geq \Theta(Lc^4 \log N / \epsilon^2)$ 条件下,LoRA的核函数与全量微调核函数高度相似,其中 $L$ 为LoRA层的数量,该结论以高概率成立。
- 理论分析证明,即使在非随机预训练权重下,提示也能在Transformer中诱导出明确定义的核函数行为机制。
- 实证结果表明,当提示具有语义意义时,核函数动态最为显著;而随机提示则无法诱导出稳定的核函数行为。
- 核函数视角为参数高效方法的成功提供了统一解释:它们在减少参数更新的同时,保留了全量微调所依赖的关键梯度结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。