Skip to main content
QUICK REVIEW

[论文解读] Benchmarking the Performance of Bayesian Optimization across Multiple Experimental Materials Science Domains

Qiaohao Liang, Aldair E. Gongora|arXiv (Cornell University)|May 23, 2021
Machine Learning and Algorithms参考文献 40被引用 11
一句话总结

该论文在五个实验材料科学领域——碳纳米管聚合物混合物、银纳米颗粒、铅卤钙钛矿以及增材制造聚合物——中对贝叶斯优化(BO)进行了基准测试,采用池基主动学习框架。研究发现,使用各向异性核(ARD)的高斯过程(GP)和随机森林(RF)优于无ARD的标准GP,为自主材料优化活动中的代理模型选择提供了实用指导。

ABSTRACT

In the field of machine learning (ML) for materials optimization, active learning algorithms, such as Bayesian Optimization (BO), have been leveraged for guiding autonomous and high-throughput experimentation systems. However, very few studies have evaluated the efficiency of BO as a general optimization algorithm across a broad range of experimental materials science domains. In this work, we evaluate the performance of BO algorithms with a collection of surrogate model and acquisition function pairs across five diverse experimental materials systems, namely carbon nanotube polymer blends, silver nanoparticles, lead-halide perovskites, as well as additively manufactured polymer structures and shapes. By defining acceleration and enhancement metrics for general materials optimization objectives, we find that for surrogate model selection, Gaussian Process (GP) with anisotropic kernels (automatic relevance detection, ARD) and Random Forests (RF) have comparable performance and both outperform the commonly used GP without ARD. We discuss the implicit distributional assumptions of RF and GP, and the benefits of using GP with anisotropic kernels in detail. We provide practical insights for experimentalists on surrogate model selection of BO during materials optimization campaigns.

研究动机与目标

  • 评估贝叶斯优化(BO)在多样化实验材料科学领域中的泛化能力和效率。
  • 识别在实验约束条件下,最有效的代理模型与获取函数组合,以实现真实世界材料优化。
  • 为在高通量实验环境中比较BO与随机采样基线的性能,提供定量指标。
  • 为自主材料发现平台中代理模型的选择,提供实用且基于数据的建议。
  • 建立一个用于评估实验材料科学中主动学习算法的基准框架,以解决现有真实数据集上系统性评估的缺乏。

提出的方法

  • 采用池基主动学习框架,模拟早期阶段材料优化,其中使用固定数量的实验数据点,迭代选择下一次实验。
  • 使用代理模型——带ARD与不带ARD的高斯过程(GP),以及随机森林(RF)——来预测目标值和不确定性。
  • 应用三种获取函数:期望改进(EI)、改进概率(PI)和置信下界(LCB),以指导实验选择。
  • 采用统计指标如加速因子和增强因子,对BO性能与随机采样进行定量比较。
  • 利用GP和RF模型的后验均值与方差计算获取函数值,其中GP依赖核函数的协方差,RF则使用集成平均。
  • 通过使用来自五个不同材料体系的真实数据集,整合实验噪声和现实世界的数据变异性,确保实证相关性。

实验结果

研究问题

  • RQ1与随机采样相比,贝叶斯优化在多样化、真实实验材料科学数据集上的表现如何?
  • RQ2在多个材料领域中,哪种代理模型——带ARD的高斯过程、不带ARD的高斯过程,还是随机森林——能实现最佳优化性能?
  • RQ3不同的获取函数(EI、PI、LCB)如何影响材料优化中的收敛速度和最终目标值?
  • RQ4代理模型中的分布假设在噪声大、真实世界实验环境中对BO性能有何影响?
  • RQ5BO的性能提升在不同材料体系中有多大差异,这些体系具有不同的设计空间复杂度和噪声特性?

主要发现

  • 使用各向异性核(ARD)的高斯过程(ARD-GP)和随机森林(RF)在所有五个材料体系中表现相当,并显著优于无ARD的标准高斯过程。
  • ARD-GP和基于RF的BO的加速因子始终高于无ARD的GP,表明其收敛到最优材料性能的速度更快。
  • 在至少三个数据集中,ARD-GP和RF模型的增强因子超过2.5倍于随机采样,表明性能有显著提升。
  • BO的性能对代理模型的选择敏感,无ARD的GP由于对输入特征重要性的错误假设,表现出较差的泛化能力。
  • 随机森林对噪声和非高斯分布表现出强健性,使其在高变异性实验环境中成为GP的有力替代方案。
  • ARD-GP与期望改进(EI)获取函数的组合在所有基准材料体系中均实现了最一致且最快的收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。