Skip to main content
QUICK REVIEW

[论文解读] Computer-Aided Multi-Objective Optimization in Small Molecule Discovery

Jenna C. Fromer, Connor W. Coley|arXiv (Cornell University)|Oct 13, 2022
Advanced Multi-Objective Optimization Algorithms参考文献 116被引用 8
一句话总结

本文全面回顾了基于Pareto优化的计算机辅助多目标分子发现,主张其优于标量化方法,能揭示无需预先加权的权衡关系。文章详述了基于分子池和从头生成的生成方法——分别采用非支配排序的强化学习、分布学习和遗传算法,强调需整合贝叶斯优化以实现可扩展、具备不确定性感知的设计。

ABSTRACT

Molecular discovery is a multi-objective optimization problem that requires identifying a molecule or set of molecules that balance multiple, often competing, properties. Multi-objective molecular design is commonly addressed by combining properties of interest into a single objective function using scalarization, which imposes assumptions about relative importance and uncovers little about the trade-offs between objectives. In contrast to scalarization, Pareto optimization does not require knowledge of relative importance and reveals the trade-offs between objectives. However, it introduces additional considerations in algorithm design. In this review, we describe pool-based and de novo generative approaches to multi-objective molecular discovery with a focus on Pareto optimization algorithms. We show how pool-based molecular discovery is a relatively direct extension of multi-objective Bayesian optimization and how the plethora of different generative models extend from single-objective to multi-objective optimization in similar ways using non-dominated sorting in the reward function (reinforcement learning) or to select molecules for retraining (distribution learning) or propagation (genetic algorithms). Finally, we discuss some remaining challenges and opportunities in the field, emphasizing the opportunity to adopt Bayesian optimization techniques into multi-objective de novo design.

研究动机与目标

  • 解决标量化在多目标分子优化中的局限性,后者假设权重固定,掩盖了相互竞争性质之间的权衡。
  • 推广Pareto优化作为更稳健、更灵活的替代方法,可在无需先验偏好下揭示全部非支配解集。
  • 系统化并比较库基与从头分子设计工作流中现有的多目标优化方法。
  • 识别在高维目标空间中可扩展性、多样性与评估方面的主要挑战。
  • 倡导将贝叶斯优化技术整合到从头设计中,以提升样本效率和不确定性量化能力。

提出的方法

  • 使用Pareto优化在无需标量化权重的情况下识别多个分子性质中的非支配解。
  • 在强化学习中应用非支配排序作为奖励函数,引导策略优化朝向多样化、高性能的分子发展。
  • 在遗传算法中使用非支配排序进行选择,并通过迭代分布学习重新训练模型,以聚焦于高质量、非支配的候选分子。
  • 通过期望超体积提升(EHI)和改进概率(PHI)等获取函数,将贝叶斯优化扩展至多目标设置。
  • 提出批量策略以促进结构多样性和Pareto多样性,从而增强对化学空间的探索。
  • 建议使用真实、高保真的目标函数和具有挑战性的基准测试,以评估算法性能,而不仅依赖QED或ClogP等简单指标。

实验结果

研究问题

  • RQ1如何系统化地制定多目标分子优化,以避免标量化的陷阱?
  • RQ2在多目标分子设计中,基于分子池与从头生成的生成方法在方法论上的关键异同点是什么?
  • RQ3Pareto优化在发现兼具平衡、相互竞争性质(如效力、溶解度与安全性)的分子方面,可如何提升?
  • RQ4如何将贝叶斯优化适配于多目标从头设计,以提升样本效率和不确定性处理能力?
  • RQ5在高维多目标优化中,主要的可扩展性挑战是什么,以及如何缓解?

主要发现

  • Pareto优化优于标量化,因其可在不假设目标相对重要性的情况下揭示完整的权衡前沿。
  • 非支配排序通过以Pareto感知选择替代贪婪获取,有效支持强化学习、遗传算法和迭代分布学习中的多目标优化。
  • 如期望超体积提升(EHI)和改进概率(PHI)等获取函数虽有效,但随目标数量增加而面临指数级计算成本。
  • 在高维目标空间中,可扩展性问题源于非支配解数量的增加以及超体积估计的计算负担。
  • 多样性感知的批量策略和真实目标函数对提升探索能力并确保真实应用中算法的鲁棒性至关重要。
  • 前瞻性实验验证仍必不可少,当前基于QED或ClogP等简单指标的基准测试不足以评估算法的真实泛化能力与性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。