Skip to main content
QUICK REVIEW

[论文解读] Black Box Recursive Translations for Molecular Optimization

Farhan Damani, Vishnu Sresht|arXiv (Cornell University)|Dec 21, 2019
Computational Drug Discovery Methods参考文献 42被引用 10
一句话总结

本文提出黑盒递归翻译(BBRT),一种新颖的推理方法,通过将生成的分子递归地反馈至任意分子翻译模型,以迭代提升其生物化学性质。作者将BBRT应用于序列模型与图神经网络模型,在仅做最小架构修改的前提下,在分子性质优化基准测试中取得最先进性能,证明了通过简单的循环优化过程可实现显著性能提升。

ABSTRACT

Machine learning algorithms for generating molecular structures offer a promising new approach to drug discovery. We cast molecular optimization as a translation problem, where the goal is to map an input compound to a target compound with improved biochemical properties. Remarkably, we observe that when generated molecules are iteratively fed back into the translator, molecular compound attributes improve with each step. We show that this finding is invariant to the choice of translation model, making this a "black box" algorithm. We call this method Black Box Recursive Translation (BBRT), a new inference method for molecular property optimization. This simple, powerful technique operates strictly on the inputs and outputs of any translation model. We obtain new state-of-the-art results for molecular property optimization tasks using our simple drop-in replacement with well-known sequence and graph-based models. Our method provides a significant boost in performance relative to its non-recursive peers with just a simple "for" loop. Further, BBRT is highly interpretable, allowing users to map the evolution of newly discovered compounds from known starting points.

研究动机与目标

  • 为解决在大规模离散化学空间中进行无约束分子性质优化的挑战。
  • 开发一种与模型无关的推理方法,无需修改底层翻译模型即可提升分子优化性能。
  • 通过允许用户检查和调试中间分子转化过程,实现可解释的、以用户为中心的分子设计。
  • 通过基于次要性质对递归输出进行排序,将分子优化扩展至多目标优化。
  • 通过在有限标注数据下利用递归优化,提升低资源场景下的泛化能力与性能。

提出的方法

  • BBRT将预训练分子翻译模型的输出递归地反馈回同一模型,以执行额外的优化步骤。
  • 该方法作为‘黑盒’操作——仅需访问任意翻译模型的输入与输出,因此具备模型无关性。
  • 递归推理由评分函数引导,该函数根据目标性质(如QED或logP)对中间分子进行排序。
  • 通过使用次要性质评分函数,该方法支持多性质优化,以指导哪些化合物被反馈至模型。
  • 用户可在任意递归步骤中应用‘分子断点’,以检查并手动选择替代的转化路径。
  • 该方法兼容多种分子表示形式(如SMILES、图、树结构),并适用于序列模型(如Seq2Seq)与图神经网络模型。

实验结果

研究问题

  • RQ1将生成的分子递归反馈至分子翻译模型,是否能在多种模型与表示形式下持续提升目标生物化学性质?
  • RQ2与非递归推理策略相比,BBRT在优化性能与收敛性方面表现如何?
  • RQ3BBRT在多大程度上可通过用户可控地检查中间转化步骤,实现可解释的分子设计?
  • RQ4在递归过程中使用次要性质评分函数,BBRT能否有效实现对多个性质的联合优化?
  • RQ5在标注数据有限的低资源设置下,BBRT是否仍能保持性能优势?

主要发现

  • BBRT在应用于知名序列与图神经网络模型时,于分子性质优化基准测试中达到新的最先进水平。
  • 在QED优化任务中,BBRT结合logP作为次要性质,达到与直接QED评分相同的最高QED值,同时平均logP值也得到提升。
  • 经过15轮递归迭代,采用logP评分的BBRT收敛至低于QED评分的平均QED值,表明在不同优化目标下长期优化存在权衡。
  • 该方法在多种解码策略(如贪婪搜索、束搜索)与模型架构中均表现出一致的性能提升。
  • 在[0.7, 0.8]范围内,logP与QED的相关性极弱(ρ = 0.007,p > 0.8),表明优化一个性质并不保证另一性质的改善,但BBRT在实践中仍能同时提升两者。
  • BBRT通过引入分子断点实现可解释设计,使用户可在任意递归步骤中探索并选择替代的转化路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。