[论文解读] Multi-Fidelity Cost-Aware Bayesian Optimization
本文提出了一种多保真度成本感知贝叶斯优化框架,通过新颖的获取函数和定制的潜在映射高斯过程(LMGP)模拟器,提升了效率、鲁棒性和收敛性。该方法能自动识别并排除严重偏差的低保真度源,同时以极低的采样成本优化昂贵的高保真度目标。
Bayesian optimization (BO) is increasingly employed in critical applications such as materials design and drug discovery. An increasingly popular strategy in BO is to forgo the sole reliance on high-fidelity data and instead use an ensemble of information sources which provide inexpensive low-fidelity data. The overall premise of this strategy is to reduce the overall sampling costs by querying inexpensive low-fidelity sources whose data are correlated with high-fidelity samples. Here, we propose a multi-fidelity cost-aware BO framework that dramatically outperforms the state-of-the-art technologies in terms of efficiency, consistency, and robustness. We demonstrate the advantages of our framework on analytic and engineering problems and argue that these benefits stem from our two main contributions: (1) we develop a novel acquisition function for multi-fidelity cost-aware BO that safeguards the convergence against the biases of low-fidelity data, and (2) we tailor a newly developed emulator for multi-fidelity BO which enables us to not only simultaneously learn from an ensemble of multi-fidelity datasets, but also identify the severely biased low-fidelity sources that should be excluded from BO.
研究动机与目标
- 为解决多保真度贝叶斯优化中低保真度数据存在偏差的挑战,此类偏差可能导致收敛错误并降低性能。
- 消除对保真度-成本关系先验知识的需求,实现跨多个数据源自动学习相对保真度水平。
- 通过联合建模多保真度数据并识别和排除不可靠的低保真度源,提升数值稳定性和采样效率。
- 开发一种鲁棒的获取函数,即使大多数样本来自廉价但有偏差的低保真度源,也能保障收敛性。
- 通过在异构数据源之间平衡成本、保真度和预测不确定性,实现在昂贵优化任务中的有效资源分配。
提出的方法
- 提出一种新颖的获取函数,整合各数据源的特定成本和预测不确定性,确保有偏差的低保真度数据不会损害收敛性。
- 采用潜在映射高斯过程(LMGP)模拟器,通过将分类和数值输入映射到共享潜在空间来建模多保真度数据,实现在不同源之间的联合学习。
- 引入一种机制,在训练过程中通过分析其与高保真度数据的预测差异,检测并排除严重偏差的低保真度源。
- 使用最大似然估计(MLE)学习LMGP的所有超参数,包括相关性结构和尺度参数,覆盖所有数据源。
- 在协方差函数中应用克罗内克积结构,以高效建模跨源相关性,同时保持计算可行性。
- 通过基于各候选点来源的保真度、成本及其对不确定性减少的贡献,加权其效用,实现成本感知的采样决策。
实验结果
研究问题
- RQ1当低保真度源高度有偏时,即使其查询成本极低,多保真度贝叶斯优化框架是否仍能保持收敛性和准确性?
- RQ2贝叶斯优化框架如何在无需预先知晓其保真度水平的情况下,自动识别并排除严重有偏的低保真度数据源?
- RQ3与最先进多保真度BO方法相比,所提出的成本感知获取函数在优化效率和鲁棒性方面提升了多少?
- RQ4所提出的框架是否能从数据中学习相对保真度水平,而非依赖用户预定义?
- RQ5潜在映射高斯过程的集成如何提升多保真度优化中的数值稳定性和预测准确性?
主要发现
- 所提出的LMGP CA框架在分析问题和工程问题上均实现了比最先进方法更快的收敛速度和更低的优化成本,包括Borehole函数和NTA/钙钛矿材料设计。
- 在Borehole函数上,即使包含严重有偏的低保真度源(LF1和LF2),该方法仍能成功避免收敛至错误最优解,而基线方法在类似条件下失败。
- 与单保真度BO相比,该框架在Borehole函数上的相对均方根误差(RRMSE)降低了高达90%,证明了其代理模型的优越准确性。
- 获取函数能有效优先选择高保真度采样,即使低保真度数据更便宜,从而减少对低保真度数据的依赖,维持收敛鲁棒性。
- LMGP模拟器基于预测差异识别并排除有偏源(如Borehole中的LF1和LF2),在无需人工干预的情况下提升模型可靠性。
- 在纳米多层三元合金(NTA)和杂化钙钛矿等工程应用中,该方法以远少于基线方法的高保真度评估次数,实现了接近最优的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。