[论文解读] Using Large Language Models for Hyperparameter Optimization
本文提出将大语言模型(LLMs)作为超参数优化(HPO)中的决策者,通过提示模型根据模型和数据集描述来建议超参数配置,甚至生成完整的训练代码。实证结果表明,LLMs在低预算设置下表现与随机搜索和贝叶斯优化相当或更优,尤其在早期探索阶段表现突出,且能生成有效代码以实现超越固定超参数空间的HPO自动化。
This paper explores the use of foundational large language models (LLMs) in hyperparameter optimization (HPO). Hyperparameters are critical in determining the effectiveness of machine learning models, yet their optimization often relies on manual approaches in limited-budget settings. By prompting LLMs with dataset and model descriptions, we develop a methodology where LLMs suggest hyperparameter configurations, which are iteratively refined based on model performance. Our empirical evaluations on standard benchmarks reveal that within constrained search budgets, LLMs can match or outperform traditional HPO methods like Bayesian optimization across different models on standard benchmarks. Furthermore, we propose to treat the code specifying our model as a hyperparameter, which the LLM outputs and affords greater flexibility than existing HPO approaches.
研究动机与目标
- 探究基础LLMs是否能有效替代传统方法来指导超参数优化(HPO)。
- 评估LLMs在搜索预算受限场景下的表现,特别是在早期阶段探索中的表现。
- 通过提示LLMs生成完整训练代码,将HPO扩展至固定超参数空间之外。
- 评估思维链推理在多次迭代中对LLM-based HPO性能的影响。
- 证明LLMs可作为通用助手,实现并提升超参数调优的自动化。
提出的方法
- 将数据集描述、模型架构以及预定义的超参数搜索空间(例如:初始学习率、批量大小、宽度、深度、L2正则化)作为提示输入给LLM。
- 模型以JSON格式输出一个超参数配置,随后通过训练和验证评估以获得指标(例如:验证损失)。
- LLM利用观测到的指标和先前历史记录,在思维链推理设置下迭代提出新的配置。
- 该方法将模型训练代码视为一个超参数,提示LLM生成可执行的PyTorch代码,以提升泛化能力并减少人为定义的搜索空间约束。
- 采用标准HPO基准(如HPOBench)对神经网络、逻辑回归、SVM和随机森林进行评估。
- 性能与随机搜索及基于高斯过程和随机森林代理模型的贝叶斯优化进行比较。
![Figure 2 : Minimum validation error achieved after $10$ function evaluations from different hyperparameter optimizers on datasets from HPOBench [ 17 ] . The benchmark defines a configuration search space on neural networks for learning rates, $\ell_{2}$ regularization, width, depth, and batch size.](https://ar5iv.labs.arxiv.org/html/2312.04528/assets/x1.png)
实验结果
研究问题
- RQ1LLMs是否能在低预算设置下有效优化超参数,超越传统HPO基线?
- RQ2思维链推理在多次迭代中如何影响LLM在复杂超参数搜索空间中的导航能力?
- RQ3LLMs在多大程度上能生成有效且高性能的训练代码,从而实现超越固定超参数配置的HPO?
- RQ4LLM对超参数性能的推理能力是否能在多种模型类型和数据集之间泛化?
- RQ5LLMs是否能在无显式搜索空间定义的情况下识别最优配置,从而减少人工工程工作量?
主要发现
- 在标准HPO基准上,LLMs仅通过10次评估即实现了与随机搜索和贝叶斯优化相当或更优的性能。
- 在5次评估的预算下,基于LLM的代码生成在超参数调优中优于随机搜索,展现出显著的自动化潜力。
- 思维链推理的使用使LLMs在30次评估步骤中保持了强劲性能,表明其在序列决策中的鲁棒性。
- LLMs在2D玩具优化问题中成功识别出最优配置,有效探索并利用了损失曲面。
- LLM生成的代码提供了强有力的初始化,减少了对人工指定超参数搜索空间的需求。
- 在多次实验中,初始配置(alpha=0.001, batch_size=32, depth=3, learning_rate_init=0.001, width=64)达到了最低损失(0.058537),LLM通过迭代分析正确识别出该配置为最优。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。