Skip to main content
QUICK REVIEW

[论文解读] BOSS: Bayesian Optimization over String Spaces

Henry B. Moss, Daniel Beck|arXiv (Cornell University)|Oct 2, 2020
Machine Learning and Algorithms参考文献 28被引用 20
一句话总结

该论文提出BOSS,一种直接在原始字符串上操作的贝叶斯优化框架,采用基于字符串核的高斯过程,无需进行潜在空间映射。通过将字符串核与基于遗传算法的采集函数最大化相结合,该方法在受约束的字符串空间(如由上下文无关文法所定义的空间)中实现了优越的优化性能,相较于基于VAE的基线方法,在极少量数据下且无需超参数调优(除两个核参数外)的情况下表现更优。

ABSTRACT

This article develops a Bayesian optimization (BO) method which acts directly over raw strings, proposing the first uses of string kernels and genetic algorithms within BO loops. Recent applications of BO over strings have been hindered by the need to map inputs into a smooth and unconstrained latent space. Learning this projection is computationally and data-intensive. Our approach instead builds a powerful Gaussian process surrogate model based on string kernels, naturally supporting variable length inputs, and performs efficient acquisition function maximization for spaces with syntactical constraints. Experiments demonstrate considerably improved optimization over existing approaches across a broad range of constraints, including the popular setting where syntax is governed by a context-free grammar.

研究动机与目标

  • 解决现有贝叶斯优化(BO)方法在字符串空间上的局限性,这些方法依赖于将字符串编码为连续潜在空间,成本高昂且数据需求量大。
  • 消除在字符串上的贝叶斯优化中对变分自编码器(VAEs)或固定长度向量表示(如n-gram袋模型)的依赖。
  • 为离散、语法受限的字符串空间开发高效的采集函数最大化策略。
  • 通过基于核函数的代理模型直接在原始字符串上进行优化,该模型能够捕捉非连续子序列间的相似性。
  • 在分子设计与基因设计等多样化字符串约束问题中,展示出更高的优化效率与鲁棒性。

提出的方法

  • 提出一种基于卷积字符串核的字符串专用核(SSK),通过共享的非连续子序列来度量可变长度字符串之间的相似性。
  • 采用以SSK作为核函数的高斯过程(GP)代理模型,实现对原始字符串输入上目标函数的平滑建模。
  • 引入一套专为离散、语法受限字符串空间(包括由上下文无关文法定义的空间)中的采集函数最大化而设计的遗传算法。
  • 仅通过少量函数评估即可微调SSK的两个超参数,避免了大规模无监督预训练的需求。
  • 使用核主成分分析(KPCA)可视化SSK的内在特征空间,结果表明其与目标函数平滑性更一致,优于基于VAE的潜在空间。
  • 将SSK-GP模型集成到标准BO循环中,支持多保真度、多目标及批量BO的扩展。

实验结果

研究问题

  • RQ1基于字符串核的高斯过程代理模型是否能在极少量数据下,优于传统基于VAE的潜在空间映射方法,在字符串空间的贝叶斯优化中表现更优?
  • RQ2基于遗传算法的采集函数最大化策略在探索离散、语法受限的字符串空间方面有多高效?
  • RQ3仅具有两个可调参数的字符串核,在分子与基因设计任务中,能在多大程度上捕捉复杂的目标函数?
  • RQ4使用SSK对原始字符串进行直接优化,是否能避免VAE方法中常见的“死区”与泛化能力差的问题?
  • RQ5SSK-GP模型是否能比VAE学习得到的潜在空间更好地保持目标函数景观的平滑性?

主要发现

  • SSK-GP模型在分子设计中优化SMILES字符串时优于基于VAE的基线方法,能在受限候选集中实现更优的探索效果。
  • 该框架成功实现了对具有语法约束的可变长度字符串的优化,包括由上下文无关文法定义的字符串,且无需固定长度编码。
  • SSK中仅需调节两个核参数,且仅通过少量函数评估即可可靠估计,显著降低了对数据的依赖。
  • 遗传算法在离散字符串空间中有效最大化采集函数,即使在复杂语法规则下也能实现高效探索。
  • KPCA可视化显示,SSK的特征空间比VAE的潜在空间更能捕捉目标函数的平滑性,后者与真实目标景观不一致。
  • 该方法避免了VAE中常见的“死区”与无效字符串解码问题,因为遗传算法确保仅探索有效字符串。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。