[论文解读] An Empirical Study on Hyperparameter Optimization for Fine-Tuning Pre-trained Language Models
本文在GLUE任务上对微调BERT和RoBERTa的超参数优化(HPO)方法——贝叶斯优化、随机搜索和早停法——进行了实证评估。尽管与网格搜索使用相同的预算时间,HPO通常表现不佳,原因在于预算不足和过拟合;然而,通过扩大预算并缩小搜索空间的系统性排查流程,HPO在多个案例中超越了网格搜索,凸显了在NLP微调中对HPO进行仔细配置和过拟合缓解的必要性。
The performance of fine-tuning pre-trained language models largely depends on the hyperparameter configuration. In this paper, we investigate the performance of modern hyperparameter optimization methods (HPO) on fine-tuning pre-trained language models. First, we study and report three HPO algorithms' performances on fine-tuning two state-of-the-art language models on the GLUE dataset. We find that using the same time budget, HPO often fails to outperform grid search due to two reasons: insufficient time budget and overfitting. We propose two general strategies and an experimental procedure to systematically troubleshoot HPO's failure cases. By applying the procedure, we observe that HPO can succeed with more appropriate settings in the search space and time budget; however, in certain cases overfitting remains. Finally, we make suggestions for future work. Our implementation can be found in https://github.com/microsoft/FLAML/tree/main/flaml/nlp/.
研究动机与目标
- 评估自动化HPO方法在相同时间预算下是否能超越传统网格搜索,用于微调预训练语言模型。
- 识别在NLP微调中HPO失败的主要原因,特别是时间预算不足和过拟合问题。
- 设计并验证一种系统性的实验流程,用于排查语言模型微调中HPO失败的原因。
- 为实际应用中提升HPO性能提供可操作的建议,尤其针对低资源或高方差的NLP任务。
提出的方法
- 本研究在两个SOTA模型(Electra和RoBERTa)上,对三种HPO方法——贝叶斯优化、随机搜索和早停法——在GLUE任务上进行评估。
- 为确保与网格搜索的公平比较,对每种HPO方法施加固定的时间预算B,其中每次试验均涉及在D_val上进行模型训练和验证。
- 搜索空间S定义在关键超参数上:初始学习率、批量大小和权重衰减,相关配置通过采样或优化获得。
- 提出一种系统性排查流程,通过迭代细化搜索空间并增加时间预算,以减少过拟合并提升HPO性能。
- 评估协议f(·)使用验证准确率(STS-B任务使用皮尔逊相关系数),最终模型性能在D_test上进行测试以评估泛化能力。
- 实验采用固定随机种子(42)以消除随机性带来的方差,确保可复现性和公平比较。
实验结果
研究问题
- RQ1在使用相同时间预算的情况下,自动化HPO方法能否在微调预训练语言模型时超越网格搜索?
- RQ2在哪些NLP任务上,HPO方法相较于网格搜索表现出更优性能?
- RQ3在微调预训练语言模型的背景下,HPO失败的主要原因是什么?
- RQ4如何系统性地缓解过拟合和预算不足问题,以提升HPO性能?
- RQ5搜索空间配置在HPO成功中扮演何种角色?如何根据模型和任务进行优化?
主要发现
- 在与网格搜索相同的预算下,HPO方法常因探索不足和对验证集的过拟合而无法超越网格搜索。
- 即使仅在学习率和批量大小上搜索,过拟合问题依然持续存在,尤其在RTE、MRPC和CoLA等任务上更为明显。
- 通过扩大时间预算并基于模型和任务特定的模式缩小搜索空间,HPO在多个GLUE任务中表现优于网格搜索。
- 在预算有限的情况下,随机搜索表现始终强劲,常与更先进的贝叶斯优化和早停法相当或更优。
- 本研究发现,默认的网格搜索配置本身已高度调优,这可能是HPO难以超越它们的原因,除非进行精心配置。
- 所提出的系统性排查流程显著提升了HPO的可靠性,揭示了搜索空间设计对成功至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。