Skip to main content
QUICK REVIEW

[论文解读] BiLoRA: A Bi-level Optimization Framework for Overfitting-Resilient Low-Rank Adaptation of Large Pre-trained Models

Rushi Qiang, Ruiyi Zhang|arXiv (Cornell University)|Mar 19, 2024
Advanced Neural Network Applications被引用 4
一句话总结

BiLoRA 提出了一种双层优化框架,以缓解在微调大规模预训练模型时低秩适配(LoRA)中的过拟合问题。通过使用 SVD 参数化,在不相交的数据子集上分离伪奇异向量和奇异值的训练,BiLoRA 提升了泛化能力并减少了训练时间,在参数量相近的情况下,相较于 LoRA 和 AdaLoRA 在 10 个 NLP 任务上表现更优。

ABSTRACT

Low-rank adaptation (LoRA) is a popular method for fine-tuning large-scale pre-trained models in downstream tasks by learning low-rank incremental matrices. Though LoRA and its variants effectively reduce the number of trainable parameters compared to full fine-tuning methods, they often overfit training data, resulting in sub-optimal generalization on test data. To address this problem, we introduce BiLoRA, an overfitting-alleviating fine-tuning approach based on bi-level optimization (BLO). BiLoRA employs pseudo singular value decomposition to parameterize low-rank incremental matrices and splits the training of pseudo singular vectors and values across two different subsets of training data. This division, embedded within separate levels of the BLO framework, mitigates the risk of overfitting to a single dataset. Tested on ten datasets covering natural language understanding and generation tasks and applied to various well-known large pre-trained models, BiLoRA significantly outperforms LoRA methods and other fine-tuning approaches, with similar amounts of trainable parameters.

研究动机与目标

  • 解决在大规模预训练模型微调过程中 LoRA 及其变体持续存在的过拟合问题。
  • 在不增加可训练参数数量的前提下,提升模型在测试数据上的泛化能力。
  • 在保持或提升性能的同时,相比标准 LoRA 缩短训练时间。
  • 开发一种参数高效的微调方法,利用双层优化解耦奇异向量与奇异值的学习过程。
  • 提供一种对超参数不敏感的鲁棒方法,避免对正则化权重进行大量调优。

提出的方法

  • 使用伪奇异值分解(SVD)参数化低秩更新矩阵,表示为 ΔW = PΛQ,其中 P 和 Q 为伪奇异向量,Λ 为伪奇异值矩阵。
  • 应用促进正交性的正则化,以确保在训练过程中 P 和 Q 保持近似正交。
  • 将训练数据划分为两个不相交的子集:一个用于在较低优化层级上训练 P 和 Q,另一个用于在较高层级上验证 Λ。
  • 在子集 S 上训练 P 和 Q,通过固定 Λ 最小化微调损失,得到 P*(Λ) 和 Q*(Λ)。
  • 在高层级上通过最小化 D\S 上的验证损失来优化 Λ,将最优的 P*(Λ) 和 Q*(Λ) 作为输入。
  • 使用 softplus 参数化处理 Λ,以实现可微且稳定的优化,支持更大的学习率并加快收敛速度。

实验结果

研究问题

  • RQ1双层优化能否在不增加可训练参数数量的前提下,有效减少 LoRA 微调中的过拟合?
  • RQ2在不相交的数据子集上分离奇异向量与奇异值的训练,如何提升模型的泛化能力?
  • RQ3与标准 LoRA 和 AdaLoRA 相比,所提出的方法是否在保持或提升性能的同时减少了训练时间?
  • RQ4BiLoRA 对超参数选择的鲁棒性如何,特别是对正交性正则化权重 γ₁ 的敏感度如何?
  • RQ5该双层框架能否有效应用于包括自然语言理解与生成在内的多样化 NLP 任务?

主要发现

  • 在 10 个多样化的 NLP 数据集(包括 CoLA、SST-2、MNLI 和 QQP)上,BiLoRA 显著优于 LoRA 和 AdaLoRA,且可训练参数数量相近。
  • 在 RoBERTa-base 模型上,BiLoRA 将总训练时间从 LoRA 的 7,802.1 分钟减少至 4,531.4 分钟,降幅达 42.5%。
  • 在 RoBERTa-large 模型上,BiLoRA 将训练时间从 LoRA 的 2,661.3 分钟减少至 2,363.8 分钟,降幅为 11.2%。
  • 该方法对超参数选择具有鲁棒性:在不同正交性正则化权重 γ₁ 的取值下,性能保持稳定,显著降低了对调优的需求。
  • 在 AdaLoRA 中增加权重衰减会恶化性能,表明传统正则化无法有效解决 LoRA 中的过拟合问题,从而验证了 BiLoRA 所提出新方法的必要性。
  • BiLoRA 的收敛所需训练轮数少于 LoRA,尽管由于双层计算导致单步成本更高,但因收敛更快,总训练时间仍更低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。