Skip to main content
QUICK REVIEW

[论文解读] MIMOSA: Multi-constraint Molecule Sampling for Molecule Optimization

Tianfan Fu, Cao Xiao|arXiv (Cornell University)|Oct 5, 2020
Computational Drug Discovery Methods参考文献 36被引用 11
一句话总结

MIMOSA 是一种用于多约束分子优化的新型采样框架,利用预训练的图神经网络(GNN)预测分子拓扑和亚结构类型,通过加法、替换和删除操作的迭代生成分子,并施加加权约束。在联合优化 DRD2 和 PLogP 属性时,其成功率相比最佳基线(GA)最高提升了 49.1%。

ABSTRACT

Molecule optimization is a fundamental task for accelerating drug discovery, with the goal of generating new valid molecules that maximize multiple drug properties while maintaining similarity to the input molecule. Existing generative models and reinforcement learning approaches made initial success, but still face difficulties in simultaneously optimizing multiple drug properties. To address such challenges, we propose the MultI-constraint MOlecule SAmpling (MIMOSA) approach, a sampling framework to use input molecule as an initial guess and sample molecules from the target distribution. MIMOSA first pretrains two property agnostic graph neural networks (GNNs) for molecule topology and substructure-type prediction, where a substructure can be either atom or single ring. For each iteration, MIMOSA uses the GNNs' prediction and employs three basic substructure operations (add, replace, delete) to generate new molecules and associated weights. The weights can encode multiple constraints including similarity and drug property constraints, upon which we select promising molecules for next iteration. MIMOSA enables flexible encoding of multiple property- and similarity-constraints and can efficiently generate new molecules that satisfy various property constraints and achieved up to 49.6% relative improvement over the best baseline in terms of success rate. The code repository (including readme file, data preprocessing and model construction, evaluation) is available https://github.com/futianfan/MIMOSA.

研究动机与目标

  • 为解决现有方法在同时优化多个药物属性时面临的挑战,这些方法通常依赖单属性优化或成对训练数据,导致性能受限。
  • 开发一种灵活且高效的框架,无需使用成对分子数据(输入分子与优化后的分子)进行训练,从而减少训练数据带来的偏差。
  • 通过马尔可夫链蒙特卡洛(MCMC)方法,实现对编码多种约束(如结构相似性和药物属性)的目标分布的有效且无偏采样。
  • 提升生成满足多个药理学和理化约束条件的分子的成功率,同时保持与给定输入分子的结构相似性。
  • 为采样过程提供收敛性和遍历性的理论保证,确保对化学空间的无偏探索。

提出的方法

  • 预训练两个与属性无关的 GNN:一个用于分子拓扑预测(mGNN),一个用于亚结构类型预测(bGNN),均使用表示原子、环和键类型的节点与边特征。
  • 利用 GNN 生成分子嵌入,以指导采样过程中每轮迭代的亚结构级操作(添加、替换、删除)。
  • 在公式 (1) 中定义目标分布 p_X(Y),通过可学习权重 η₀、η₁、η₂ 综合相似性(Tanimoto)和属性约束(如 PLogP、QED、DRD2)。
  • 采用马尔可夫链蒙特卡洛(MCMC)采样策略,基于亚结构操作生成新分子,并按与目标分布权重成比例的概率接受。
  • 使用预 burn-in 阶段(T_burnin = 5)和最大迭代次数(T_max = 10)以稳定采样并确保收敛。
  • 在 MCMC 过程中采用加权接受准则,平衡探索与约束满足,每轮迭代保留 20 个分子。

实验结果

研究问题

  • RQ1基于采样的框架能否在保持与给定分子结构相似性的同时,有效实现多个药物属性(如 PLogP、QED、DRD2)的联合优化?
  • RQ2预训练的 GNN 用于拓扑和亚结构预测能否在无需成对训练数据的情况下,显著提升生成分子的质量与有效性?
  • RQ3所提出的基于 MCMC 的采样策略结合多约束加权机制,能否确保收敛并实现对目标分布的无偏采样?
  • RQ4在多属性优化任务中,MIMOSA 相较于最先进基线(如 GA、JTVAE、VJTNN、GCPN)的成功率表现如何?
  • RQ5该框架能否在无需微调或成对数据的情况下,灵活编码多样化的约束(如相似性、多种理化属性)?

主要发现

  • MIMOSA 在联合优化 DRD2 和 PLogP 时取得了 43.7% 的成功率,相比表现最佳的基线(GA)实现了 49.1% 的相对提升。
  • 该框架在多种属性优化设置下表现优异,包括 QED+PLogP 和 DRD+PLogP,成功率始终超过所有基线。
  • 利用预训练的 GNN 进行亚结构和拓扑预测,显著提升了采样效率与分子有效性,且无需成对分子数据。
  • 理论分析证实,MCMC 采样过程具有遍历性并收敛至目标分布,确保对化学空间的无偏探索。
  • 即使在严格的相似性约束下(如 Tanimoto 相似度 ≥ 0.3),框架仍能实现高成功率,表明其在新颖性与结构保真度之间实现了有效平衡。
  • 消融实验表明,GNN 预训练和多约束加权机制对高性能至关重要,其缺失会导致成功率显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。