[论文解读] LassoBench: A High-Dimensional Hyperparameter Optimization Benchmark Suite for Lasso
LassoBench 引入了首个专为加权Lasso回归设计的高维超参数优化(HD-HPO)基准测试套件,支持在合成数据集和真实世界数据集上对HD-HPO方法进行严格评估。结果表明,贝叶斯优化和如CMA-ES这样的进化策略在稀疏回归任务中,尤其是在高维、噪声较大的场景下,可显著优于标准Lasso基线方法。
While Weighted Lasso sparse regression has appealing statistical guarantees that would entail a major real-world impact in finance, genomics, and brain imaging applications, it is typically scarcely adopted due to its complex high-dimensional space composed by thousands of hyperparameters. On the other hand, the latest progress with high-dimensional hyperparameter optimization (HD-HPO) methods for black-box functions demonstrates that high-dimensional applications can indeed be efficiently optimized. Despite this initial success, HD-HPO approaches are mostly applied to synthetic problems with a moderate number of dimensions, which limits its impact in scientific and engineering applications. We propose LassoBench, the first benchmark suite tailored for Weighted Lasso regression. LassoBench consists of benchmarks for both well-controlled synthetic setups (number of samples, noise level, ambient and effective dimensionalities, and multiple fidelities) and real-world datasets, which enables the use of many flavors of HPO algorithms to be studied and extended to the high-dimensional Lasso setting. We evaluate 6 state-of-the-art HPO methods and 3 Lasso baselines, and demonstrate that Bayesian optimization and evolutionary strategies can improve over the methods commonly used for sparse regression while highlighting limitations of these frameworks in very high-dimensional and noisy settings.
研究动机与目标
- 为稀疏回归模型(如加权Lasso)的超参数优化(HPO)缺乏真实、高维的基准测试提供解决方案。
- 提供一个可复现、开源的基准测试套件,支持具有可调噪声水平和有效维度的合成与真实世界数据集。
- 实现对最先进HD-HPO方法在具有强统计保证的模型类别上的系统性评估与改进。
- 弥合HD-HPO理论进展与基因组学、金融学和脑成像等实际应用之间的差距。
提出的方法
- LassoBench 基于加权Lasso(wLasso)模型构建,该模型为每个特征分配独立的超参数,从而实现比标准Lasso更优的稀疏性控制。
- 基准测试包含具有受控参数的合成数据集:样本数量、信噪比(SNR)水平、环境维度以及用户自定义的有效维度子空间。
- 通过暴露多个数据保真度级别,支持多保真度优化,从而实现高效的HPO并支持早期停止。
- 该套件集成了标准Lasso基线方法(如LassoCV、AdaptiveLassoCV)和最先进的HD-HPO方法(如CMA-ES、TuRBO、Sparse-HO、Hyperband),用于对比评估。
- 以交叉验证为主要评估指标,未来版本将支持额外的验证标准。
- 该框架设计具备可扩展性和可复现性,支持在包括白血病和RCV1在内的多样化真实世界数据集的无噪声与有噪声设置下运行。
实验结果
研究问题
- RQ1高维贝叶斯优化和进化策略是否能在稀疏回归任务中超越基于标准Lasso的超参数调优方法?
- RQ2在高维Lasso问题中,HD-HPO方法在不同噪声水平和有效维度下的表现如何?
- RQ3多保真度优化和低维子空间假设对wLasso中HPO性能有何影响?
- RQ4不同HPO方法在环境维度增加时的扩展性如何,特别是在RCV1(d=19,959)等计算挑战较大的场景下?
- RQ5结合Lasso基线与HD-HPO方法的混合策略是否能提升收敛速度和最终性能?
主要发现
- 在白血病数据集上,CMA-ES实现了0.015的MSE,相比第二好的方法(Multi-start Sparse-HO,0.06 MSE)提升了75%。
- 在RCV1基准测试中,LassoCV和AdaptiveLassoCV分别取得了最佳MSE(0.187和0.215),优于所有其他HPO方法。
- CMA-ES在白血病数据集上收敛迅速并全面超越所有基线方法,而TuRBO的性能早期即趋于平缓,未能进一步改善至0.39 MSE以下。
- Sparse-HO通过多次随机启动在RCV1上实现了0.25的MSE,优于随机搜索(0.277)和Hyperband(0.265),但仍不及基于Lasso的基线方法。
- HeSBO在d_low=2时于RCV1上实现了0.247的MSE,略优于Sparse-HO,但仍落后于LassoCV基线。
- 该基准测试表明,标准Lasso基线方法依然极具竞争力,但在高维、噪声较大的场景下,CMA-ES和Sparse-HO等HD-HPO方法仍可超越它们。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。