[论文解读] Rethinking Learning Rate Tuning in the Era of Large Language Models
本文挑战了大型语言模型(LLM)学习率(LR)调优中的传统观念,表明标准策略(如余弦退火)往往表现不如固定学习率。通过 LRBench++,作者在深度神经网络(DNN)和 LLM 上对多种学习率策略进行了基准测试,揭示了训练损失作为 LLM 任务性能的代理指标并不可靠,且固定学习率调度在 ARC 和 HellaSwag 基准上尤其优于自适应策略。
Large Language Models (LLMs) represent the recent success of deep learning in achieving remarkable human-like predictive performance. It has become a mainstream strategy to leverage fine-tuning to adapt LLMs for various real-world applications due to the prohibitive expenses associated with LLM training. The learning rate is one of the most important hyperparameters in LLM fine-tuning with direct impacts on both fine-tuning efficiency and fine-tuned LLM quality. Existing learning rate policies are primarily designed for training traditional deep neural networks (DNNs), which may not work well for LLM fine-tuning. We reassess the research challenges and opportunities of learning rate tuning in the coming era of Large Language Models. This paper makes three original contributions. First, we revisit existing learning rate policies to analyze the critical challenges of learning rate tuning in the era of LLMs. Second, we present LRBench++ to benchmark learning rate policies and facilitate learning rate tuning for both traditional DNNs and LLMs. Third, our experimental analysis with LRBench++ demonstrates the key differences between LLM fine-tuning and traditional DNN training and validates our analysis.
研究动机与目标
- 重新评估在大型语言模型(LLM)微调背景下现有学习率策略的有效性,其中传统 DNN 的假设可能不再适用。
- 识别 LLM 学习率调优中的核心挑战,包括训练损失与特定任务性能指标之间的脱节。
- 开发并验证 LRBench++ 作为系统性评估传统 DNN 和 LLM 上学习率策略的基准工具。
- 提供实证证据表明,固定学习率调度在 LLM 微调中可优于广泛使用的自适应调度(如余弦退火)。
- 为未来研究提供指导,推动面向 LLM 微调独特动态的低成本、高性能学习率调优策略。
提出的方法
- 在 LLM 微调背景下重新评估既定的学习率策略(如余弦退火、学习率预热、ReduceLROnPlateau),并与它们在传统 DNN 训练中的应用进行对比。
- 设计并实现 LRBench++,一个基准测试框架,统一 DNN 和 LLM 的超参数配置、训练协议和评估指标。
- 整合多种评估指标,超越训练损失,包括 ARC 和 HellaSwag 等特定任务基准,以评估微调后模型的性能。
- 在多个 LLM(如 Alpaca-7B、Vicuna-7B、WizardLM-7B)和数据集上开展受控实验,对比固定、余弦和预热学习率调度。
- 使用基于梯度的优化,以 Adam 作为默认优化器,通过标准 Adam 更新规则跟踪参数更新:$\Theta_{t+1} = \Theta_t - \eta(t) \frac{\hat{M}_t}{\sqrt{\hat{V}_t} + \epsilon}$。
- 分析训练损失趋势与下游任务性能之间的相关性,识别出非单调、阶梯状的损失模式,这些模式可作为模型性能提升的信号。
实验结果
研究问题
- RQ1为传统 DNN 设计的标准学习率策略在应用于 LLM 微调时表现如何?
- RQ2在 LLM 微调过程中,训练损失与下游任务性能(如 ARC、HellaSwag)的相关性有多大?
- RQ3在特定基准上,固定学习率调度能否优于余弦退火等自适应调度?
- RQ4LLM 微调与传统 DNN 训练在优化动态方面存在哪些关键差异,从而影响学习率策略的有效性?
- RQ5像 LRBench++ 这样的标准化基准测试框架,如何改善 LLM 学习率策略的系统性评估与选择?
主要发现
- 固定学习率调度(如恒定的 $2 \times 10^{-5}$)在 ARC 和 HellaSwag 基准上持续优于自适应策略(如余弦退火),实现了最高的特定任务准确率。
- LLM 微调过程中的训练损失表现出非单调、阶梯状的下降模式——尤其在第 2 和第 3 个周期出现显著下降——表明损失并非模型性能的可靠代理。
- 固定学习率 $2 \times 10^{-5}$ 的训练损失高于其他调度策略,但其在 ARC 和 HellaSwag 上的表现最佳,表明损失与任务准确率之间存在脱节。
- 实践中广泛采用的学习率策略(如 Vicuna-7B 和 WizardLM-7B 中使用的 $2 \times 10^{-5}$ 余弦退火)并未带来最优结果,表明当前默认设置并非最优。
- 基于状态的调度器(如 ReduceLROnPlateau)在 LLM 微调中无效,因为它们依赖于损失监控,而损失无法反映实际任务性能。
- 实验结果证实,LLM 微调具有与传统 DNN 训练不同的独特优化动态,因此需要重新思考学习率调优策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。