[论文解读] Activity Cliff Prediction: Dataset and Benchmark
本文提出了ACNet,这是首个用于活动悬崖(AC)预测的大规模基准数据集,包含跨190个靶标的40多万对匹配分子对(MMPs),其中包含2万对MMP悬崖。该研究提出了一套基线框架,评估了16种深度学习模型,发现传统ECFP指纹在数据稀缺和分布外设置下表现优于大多数深度神经网络,凸显了深度学习模型在AC预测方面面临的挑战。
Activity cliffs (ACs), which are generally defined as pairs of structurally similar molecules that are active against the same bio-target but significantly different in the binding potency, are of great importance to drug discovery. Up to date, the AC prediction problem, i.e., to predict whether a pair of molecules exhibit the AC relationship, has not yet been fully explored. In this paper, we first introduce ACNet, a large-scale dataset for AC prediction. ACNet curates over 400K Matched Molecular Pairs (MMPs) against 190 targets, including over 20K MMP-cliffs and 380K non-AC MMPs, and provides five subsets for model development and evaluation. Then, we propose a baseline framework to benchmark the predictive performance of molecular representations encoded by deep neural networks for AC prediction, and 16 models are evaluated in experiments. Our experimental results show that deep learning models can achieve good performance when the models are trained on tasks with adequate amount of data, while the imbalanced, low-data and out-of-distribution features of the ACNet dataset still make it challenging for deep neural networks to cope with. In addition, the traditional ECFP method shows a natural advantage on MMP-cliff prediction, and outperforms other deep learning models on most of the data subsets. To the best of our knowledge, our work constructs the first large-scale dataset for AC prediction, which may stimulate the study of AC prediction models and prompt further breakthroughs in AI-aided drug discovery. The codes and dataset can be accessed by https://drugai.github.io/ACNet/.
研究动机与目标
- 为药物发现中的活动悬崖(AC)预测解决缺乏标准化基准数据集的问题。
- 利用大规模、多样化且包含数据不平衡、低数据量和分布外子集的基准数据集,评估深度学习模型在AC预测中的性能。
- 探究尽管在分子性质预测任务中表现成功,深度神经网络在捕捉细微活动悬崖现象方面仍存在的局限性。
- 通过提供可复现的基准和开源资源,为未来人工智能辅助药物发现研究奠定基础。
提出的方法
- 从ChEMBL中整理ACNet,提取了跨190个靶标的40多万对匹配分子对(MMPs),其中2万对被标记为MMP悬崖,38万对为非AC。
- 设计了五个不同的数据子集——Large、Medium、Small、Few和Mix,分别强调不同挑战:数据不平衡、低数据量情形和分布外泛化能力。
- 实现了一个统一的基线框架,将16种模型(如GCN、GIN、Graphormer、ECFP)的分子表征输入下游MLP,用于AC关系的二分类。
- 在所有子集上应用标准评估指标(AUC、准确率),包括在目标划分下的评估以衡量分布外泛化能力。
- 在Few子集上采用预训练-微调范式,固定预训练的分子表征模型,仅微调分类器头。
- 对比了深度图神经网络与传统指纹方法(ECFP)的性能,以评估学习表征与人工设计表征的有效性。
实验结果
研究问题
- RQ1深度学习模型能否在结构变化极小但活性差异显著的分子对中有效预测活动悬崖关系?
- RQ2在不同数据可用性条件下的数据集上,不同分子表征学习方法(如GNN、ECFP)在AC预测中的性能如何比较?
- RQ3深度学习模型在未在训练中见过的分布外(OOD)靶标上泛化能力如何,特别是在目标划分评估下?
- RQ4为何ECFP在AC预测中表现优于最先进深度学习模型,尤其是在低数据和OOD设置下?
- RQ5AC预测中存在哪些关键挑战,导致尽管在其他分子性质预测任务中表现成功,深度神经网络仍难以取得良好性能?
主要发现
- ECFP配合简单MLP在Large子集上取得了0.984的最高AUC,优于所有深度学习模型,包括Graphormer和GIN。
- 在Few子集上,ECFP取得了0.813的AUC,在8种预训练模型中排名第二,而大多数基于GNN的模型表现不如ECFP,表明ECFP在低数据环境下具有更强鲁棒性。
- 在Mix子集上,目标划分评估下性能显著下降,ECFP+MLP的AUC从随机划分下的0.960降至0.522,表明其分布外泛化能力差。
- GCN在Mix子集上的OOD性能最佳,AUC为0.579,但仍表明其在跨靶标捕捉可泛化模式方面存在显著失败。
- GIN和Graphormer模型在小样本和少样本子集上表现欠佳,AUC均低于0.63,表明其在稀疏数据中学习能力有限。
- 结果表明,由于数据不平衡、低数据量情形和分布偏移,AC预测对深度学习仍构成重大挑战,即使采用了先进的分子表征学习方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。