Skip to main content
QUICK REVIEW

[论文解读] Batched Stochastic Bayesian Optimization via Combinatorial Constraints Design

Kevin Yang, Yuxin Chen|arXiv (Cornell University)|Apr 17, 2019
Advanced Multi-Objective Optimization Algorithms参考文献 23被引用 7
一句话总结

本文提出批量随机贝叶斯优化(BSBO)用于蛋白质工程中的位点饱和突变,通过优化蛋白质位点上氨基酸选择的约束,以最大化随机批次中高价值序列的期望数量。该研究引入了Online-DSOpt算法,通过将目标函数分解为子模函数之差(DS),实现高效优化,其性能优于合成数据集和真实蛋白质数据集(GB1、PhoQ)上的启发式方法,包括发现稀有且高适应度的序列。

ABSTRACT

In many high-throughput experimental design settings, such as those common in biochemical engineering, batched queries are more cost effective than one-by-one sequential queries. Furthermore, it is often not possible to directly choose items to query. Instead, the experimenter specifies a set of constraints that generates a library of possible items, which are then selected stochastically. Motivated by these considerations, we investigate \emph{Batched Stochastic Bayesian Optimization} (BSBO), a novel Bayesian optimization scheme for choosing the constraints in order to guide exploration towards items with greater utility. We focus on \emph{site-saturation mutagenesis}, a prototypical setting of BSBO in biochemical engineering, and propose a natural objective function for this problem. Importantly, we show that our objective function can be efficiently decomposed as a difference of submodular functions (DS), which allows us to employ DS optimization tools to greedily identify sets of constraints that increase the likelihood of finding items with high utility. Our experimental results show that our algorithm outperforms common heuristics on both synthetic and two real protein datasets.

研究动机与目标

  • 解决在直接项目查询不可行且批次随机采样的高通量实验环境中,库设计优化的挑战。
  • 开发一种模型驱动的框架,用于在位点饱和突变中选择约束条件,以最大化每批次中改进蛋白序列的期望数量。
  • 克服真实生化实验中可能约束集合的组合爆炸以及随机采样不确定性的挑战。
  • 实现实时、高效的约束集合优化,引导探索向高适应度蛋白序列迈进,而无需进行全面筛选。

提出的方法

  • 提出一种新颖的近似目标函数,将单个蛋白序列的效用映射到约束空间,捕捉随机批次中的期望改进。
  • 将目标函数分解为子模函数之差(DS),利用DS优化工具(如DSOpt-SA和DSOpt-DC)实现高效优化。
  • 开发Online-DSOpt,一种在线算法,通过在批次采样约束下迭代改进DS分解后的目标函数,贪心地选择约束集合。
  • 使用具有Matérn核的高斯过程回归来建模蛋白质功能-结构关系,并预测序列效用。
  • 采用随机批次采样机制,每轮迭代从约束定义的文库中以替换方式抽取序列。
  • 从非空约束集合(例如,单个最优查询)开始优化,以避免在空集处陷入局部最优。

实验结果

研究问题

  • RQ1基于模型的、基于约束的优化框架是否能在位点饱和突变的蛋白文库选择中超越临时启发式方法?
  • RQ2如何通过战略性约束设计,最大化随机批次中改进序列的期望数量?
  • RQ3批量随机贝叶斯优化的目标函数能否被高效地分解为子模函数之差,以实现可扩展优化?
  • RQ4所提方法在多大程度上能发现稀有且高适应度的蛋白序列,这些序列通过随机采样或单突变启发式方法极难被找到?

主要发现

  • 在合成数据集上,Online-DSOpt在所有批次大小下显著优于贪心启发式方法(Greedy-Add、Greedy-Rem),尤其在小批次规模下,贪心方法失效时表现更优。
  • DSOpt-SA与DSOpt-DC的性能与完整贪心算法相当,表明尽管无全局收敛保证,仍能有效探索约束空间。
  • 在GB1和PhoQ蛋白数据集上,Online-DSOpt识别出适应度值达到或超过第99.8百分位的序列,这些序列极为稀有,通常在少于500次随机采样中难以发现。
  • 该方法成功识别出多氨基酸位点组合,其适应度提升超越了单突变或最佳突变重组策略,证明其在上位性景观中的有效性。
  • 在三轮模拟(批次大小为100)中,Online-DSOpt持续发现改进序列,包括超越了野生型和单突变基线的序列。
  • 该算法在减小有效文库大小的同时,提高了采样到高价值序列的概率,使大规模突变实验更加可行和高效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。