Skip to main content
QUICK REVIEW

[论文解读] Lo-Hi: Practical ML Drug Discovery Benchmark

Simon Steshin|arXiv (Cornell University)|Oct 10, 2023
Computational Drug Discovery Methods被引用 5
一句话总结

本文提出了 Lo-Hi,一个面向药物发现的实用机器学习基准,将两个不同的现实世界任务分离:命中识别(Hi),专注于预测全新、结构迥异分子的性质;以及先导优化(Lo),针对已知活性化合物的微小结构修改。作者提出了一种基于平衡顶点最小 $k$-划分问题的新型分子分割算法,以创建真实、无重叠的数据集,揭示了模型在这两个任务上的表现存在显著差异:在 Hi 任务中,Chemprop 表现优于其他模型;在 Lo 任务中,SVM 搭配 ECFP4 特征表现最佳。

ABSTRACT

Finding new drugs is getting harder and harder. One of the hopes of drug discovery is to use machine learning models to predict molecular properties. That is why models for molecular property prediction are being developed and tested on benchmarks such as MoleculeNet. However, existing benchmarks are unrealistic and are too different from applying the models in practice. We have created a new practical \emph{Lo-Hi} benchmark consisting of two tasks: Lead Optimization (Lo) and Hit Identification (Hi), corresponding to the real drug discovery process. For the Hi task, we designed a novel molecular splitting algorithm that solves the Balanced Vertex Minimum $k$-Cut problem. We tested state-of-the-art and classic ML models, revealing which works better under practical settings. We analyzed modern benchmarks and showed that they are unrealistic and overoptimistic. Review: https://openreview.net/forum?id=H2Yb28qGLV Lo-Hi benchmark: https://github.com/SteshinSS/lohi_neurips2023 Lo-Hi splitter library: https://github.com/SteshinSS/lohi_splitter

研究动机与目标

  • 为填补现有基准的空白,创建一个反映实际药物发现工作流程中分子性质预测的现实评估框架。
  • 识别为何当前基准(如 MoleculeNet)过于乐观,并无法反映药物发现中的真实挑战。
  • 开发一种新型数据集分割方法,确保分子新颖性与无重叠,模拟实际筛选条件。
  • 在现实的 Hi 和 Lo 场景下评估最先进与经典机器学习模型,以确定各类架构在不同任务中的适用性。
  • 证明模型性能显著依赖于任务背景,挑战了‘高基准分数即代表实际应用价值’的假设。

提出的方法

  • 提出了一套新的基准框架,包含两个独立任务:命中识别(Hi)与先导优化(Lo),以反映实际药物发现的两个阶段。
  • 设计了一种基于整数线性规划的新型分子分割算法,用于求解平衡顶点最小 $k$-划分问题,确保训练集与测试集无重叠、多样化且真实。
  • 使用真实分子数据创建了七个新的实用数据集,分别用于 Hi 和 Lo 任务,经过仔细筛选以保持新颖性与结构多样性。
  • 采用标准化指标(如 AUC-PR 和斯皮尔曼等级相关系数)对 XGBoost、SVM、MLP、Chemprop 和 Graphormer 等多种模型在两个任务上进行评估。
  • 通过随机搜索与早停法进行超参数调优,基于验证性能选择模型,以避免数据泄露。
  • 对 Lo 任务采用基于聚类的评估方式,计算分子聚类内的斯皮尔曼等级相关系数,并对聚类结果取平均,以反映实际优化场景。
Figure 1: Hit Identification (Hi) task
Figure 1: Hit Identification (Hi) task

实验结果

研究问题

  • RQ1当在现实药物发现条件下评估时,最先进与经典机器学习模型的表现如何,特别是在区分全新分子与已知活性分子方面?
  • RQ2由于不切实际的数据划分与任务设定,现有基准(如 MoleculeNet)在多大程度上高估了模型性能?
  • RQ3在命中识别与先导优化任务中,哪些机器学习架构最适合,考虑到二者对泛化能力与对微小结构变化敏感性的不同需求?
  • RQ4基于平衡顶点最小 $k$-划分问题的新型分子分割算法,是否能产生比标准随机分割或骨架分割更真实、更具实用性的基准数据集?
  • RQ5当采用基于聚类的斯皮尔曼等级相关系数(用于 Lo)与标准 AUC-PR(用于 Hi)进行评估时,模型性能如何变化?这对实际中的模型选择有何启示?

主要发现

  • Lo-Hi 基准揭示,为 MoleculeNet 风格基准优化的模型在命中识别任务中往往无法泛化到真正新颖的分子,表明当前基准过于乐观。
  • Chemprop 在 Hi 任务中始终表现优于其他模型,在多个数据集上取得最高 AUC-PR,包括在 HIV-Hi 上达到 0.92,在 DRD2-Hi 上达到 0.88。
  • 在 Lo 任务中,SVM 搭配 ECFP4 特征实现了最佳平均斯皮尔曼等级相关系数(在 KDR-Lo 上达 0.78),显著优于深度学习模型如 Graphormer 和 Chemprop。
  • 基于平衡顶点最小 $k$-划分问题的新型分子分割算法成功生成了无重叠、多样化的数据集,更真实地反映了现实世界的筛选条件。
  • Graphormer 表现欠佳,并面临显著的技术挑战,包括依赖项问题与训练速度慢,尽管其架构复杂,但实用性受限。
  • 本研究证明,模型选择必须基于任务特性:Hi 任务需要具备强泛化能力以应对全新结构的模型,而 Lo 任务则要求对微小化学结构变化具有高度敏感性。
Figure 2: Lead Optimization (Lo) task
Figure 2: Lead Optimization (Lo) task

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。