[论文解读] Step Change Improvement in ADMET Prediction with PotentialNet Deep Featurization
本文提出 PotentialNet,一种图卷积神经网络,可直接从分子图中学习深层分子表征,在 ADMET 属性预测中达到最先进性能。通过用端到端的基于图的学习方法替代固定的指纹特征化方法,PotentialNet 显著提升了在多样化 ADMET 末端上的插值与外推准确性,相较于使用成对描述符的传统随机森林模型,平均 R² 提升超过 30%。
The Absorption, Distribution, Metabolism, Elimination, and Toxicity (ADMET) properties of drug candidates are estimated to account for up to 50% of all clinical trial failures. Predicting ADMET properties has therefore been of great interest to the cheminformatics and medicinal chemistry communities in recent decades. Traditional cheminformatics approaches, whether the learner is a random forest or a deep neural network, leverage fixed fingerprint feature representations of molecules. In contrast, in this paper, we learn the features most relevant to each chemical task at hand by representing each molecule explicitly as a graph, where each node is an atom and each edge is a bond. By applying graph convolutions to this explicit molecular representation, we achieve, to our knowledge, unprecedented accuracy in prediction of ADMET properties. By challenging our methodology with rigorous cross-validation procedures and prospective analyses, we show that deep featurization better enables molecular predictors to not only interpolate but also extrapolate to new regions of chemical space.
研究动机与目标
- 通过改进这些属性的计算预测,解决药物开发中因 ADMET 相关问题导致的高失败率。
- 克服固定的手工分子描述符(如 ECFP、原子对)在特征空间中破坏结构关系的局限性。
- 开发一种深度学习框架,直接从分子图中学习任务特定的分子表征,保留拓扑与化学关系。
- 在插值与外推至新型化学空间区域方面均表现出优越性能,尤其强调外推能力。
- 通过严格的交叉验证、时间序列划分以及在真实世界药物发现数据上的前瞻性测试验证该方法。
提出的方法
- 将分子表示为无向图,原子作为节点,化学键作为边,使用 $N_{atoms} \times f_{in}$ 特征矩阵 $X$ 和 $N_{atoms} \times N_{atoms}$ 邻接矩阵 $A$。
- 应用 $K$ 个图卷积层,聚合邻近原子的特征,学习分子结构的分层表征。
- 使用图池化操作将原子级特征汇总为全局分子表征,用于回归或分类任务。
- 使用反向传播进行端到端训练,回归任务采用均方误差(MSE)损失,分类任务采用二元交叉熵损失。
- 与传统模型(如随机森林)进行对比,使用相同数据但采用固定的成对描述符特征化方法。
- 应用多种验证方案:标准 k 折交叉验证、时间序列划分、分子量划分,以及在训练期间未见数据上的前瞻性测试。
实验结果
研究问题
- RQ1一种直接从图结构化数据学习分子表征的深度学习模型,是否能在 ADMET 预测中超越使用固定指纹的传统化学信息学模型?
- RQ2与固定描述符方法相比,基于图的特征化方法是否能实现对新型化学空间的更好外推?
- RQ3PotentialNet 在多样化 ADMET 末端上的性能与基线模型(如使用成对描述符的随机森林)相比如何?
- RQ4该模型在未用于训练的真实世界药物发现数据上的前瞻性、实际应用中,其泛化能力如何?
- RQ5模型学习到的表征是否可解释,能否识别出影响 ADMET 属性的关键结构特征?
主要发现
- PotentialNet 在 17 个 ADMET 末端上实现了平均 R² 为 0.579,而使用成对描述符的随机森林模型为 0.503,相对提升 14.7%。
- 在 2018 年 11 月至 2019 年 2 月数据的前瞻性测试中,PotentialNet 维持了高性能(平均 R² = 0.542),在保留的、真实世界的化合物上优于基线模型(R² = 0.478)。
- 该模型在外推性能上提升最大,尤其在 hERG 抑制(R² 从 0.306 提升至 0.445)和 PGP 外排(R² 从 0.349 提升至 0.468)等具有挑战性的末端上,传统模型表现不佳。
- 在文献中的大环化合物数据上,PotentialNet 对 logD 的预测 R² 达到 0.603,而随机森林仅为 0.394,表明其对结构多样、复杂的分子具有强大的泛化能力。
- 可解释性分析显示,模型正确识别出关键药效团——如大环核心和特定杂原子模式——为预测影响最大的结构特征。
- 时间序列与分子量划分评估结果表明,PotentialNet 在训练数据之外的泛化能力出色,尤其在外推区域表现优异,而传统模型在此类场景下往往失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。