[论文解读] A Quantile-based Approach for Hyperparameter Transfer Learning
该论文提出了一种基于分位数的迁移学习方法,用于超参数优化,采用半参数高斯Copula模型处理跨任务的异质尺度和噪声问题。通过建模从超参数到目标分位数的映射关系,该方法利用Thompson采样和高斯Copula过程实现鲁棒的迁移学习,在超参数调优和神经架构搜索中均显著优于当前最先进方法,包括在延迟与准确率权衡的多目标场景下表现优异。
Bayesian optimization (BO) is a popular methodology to tune the hyperparameters of expensive black-box functions. Traditionally, BO focuses on a single task at a time and is not designed to leverage information from related functions, such as tuning performance objectives of the same algorithm across multiple datasets. In this work, we introduce a novel approach to achieve transfer learning across different \emph{datasets} as well as different \emph{objectives}. The main idea is to regress the mapping from hyperparameter to objective quantiles with a semi-parametric Gaussian Copula distribution, which provides robustness against different scales or outliers that can occur in different tasks. We introduce two methods to leverage this mapping: a Thompson sampling strategy as well as a Gaussian Copula process using such quantile estimate as a prior. We show that these strategies can combine the estimation of multiple objectives such as latency and accuracy, steering the hyperparameters optimization toward faster predictions for the same level of accuracy. Extensive experiments demonstrate significant improvements over state-of-the-art methods for both hyperparameter optimization and neural architecture search.
研究动机与目标
- 解决在超参数优化中,不同任务间存在尺度差异与噪声水平差异的知识迁移挑战。
- 开发一种方法,能够鲁棒地处理相关任务间异质数据分布的问题,而无需假设正态分布或严格标准化。
- 通过将准确率与延迟等指标通过标量化Copula目标函数结合,将迁移学习扩展至多目标优化场景。
- 通过基于分位数映射的半参数先验,利用相关任务的先前评估结果,提升贝叶斯优化的效率。
- 为超参数优化与神经架构搜索中的现有迁移学习方法提供一种可扩展且鲁棒的替代方案。
提出的方法
- 使用半参数高斯Copula对从超参数到目标分位数的映射关系进行建模,将各任务的观测值转换为可比较的边际分布。
- 利用各任务目标值的经验累积分布函数(CDF),构建考虑尺度差异与异常值差异的联合分布。
- 实施Thompson采样策略,从基于Copula的后验分布中采样,以在多任务设置中平衡探索与利用。
- 引入高斯Copula过程(GCP),利用分位数估计作为非平稳、非参数先验,指导超参数选择。
- 通过平均Copula变换后的目标值,将框架扩展至多目标优化,实现对Pareto前沿更优的逼近,优于线性标量化方法。
- 将该方法应用于标准超参数优化与神经架构搜索,证明在多种数据集与指标下均保持一致的性能提升。
实验结果
研究问题
- RQ1半参数高斯Copula模型能否有效处理相关超参数优化任务间存在的异质尺度与噪声水平?
- RQ2与标准迁移学习基线相比,使用基于分位数的Copula先验是否能提升贝叶斯优化的性能?
- RQ3所提出的方法能否高效结合神经架构搜索中的多个目标(如准确率与延迟)?
- RQ4与线性标量化方法相比,基于Copula的方法在多目标优化中对真实Pareto前沿的逼近效果如何?
- RQ5该方法能否超越同一算法在不同数据集上的应用,推广至超参数维度不同的各类任务?
主要发现
- 在多个数据集上,所提方法在超参数优化中显著优于当前最先进迁移学习基线,收敛速度更快,遗憾值更低。
- 在神经架构搜索中,该方法相较于现有方法实现了更低的超体积误差,表明其对Pareto前沿的逼近能力更优。
- 使用高斯Copula使方法在重尾或易受异常值影响的数据分布下仍保持鲁棒性能,优于标准化与基于秩的方法。
- 在多任务设置中,使用Copula先验的Thompson采样始终比标准获取函数实现更高的优化效率。
- 标量化Copula目标函数对Pareto前沿的逼近优于线性标量化,尤其在目标间存在非凸权衡几何结构时表现更优。
- 该方法在真实世界HPO与NAS工作负载中具备良好的可扩展性,实验表明在AWS基础设施上实现了显著的速度提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。