[论文解读] ImDrug: A Benchmark for Deep Imbalanced Learning in AI-aided Drug Discovery
ImDrug 提出了一项针对人工智能辅助药物发现中深度类别不平衡学习的综合性基准,包含11个AI就绪数据集、54项学习任务以及在四种不平衡设置下的16种基线算法。该研究表明,标准指标如准确率在不平衡数据上过于乐观,建议采用平衡准确率和F1分数作为更可靠的替代指标,并揭示了现有模型在真实世界分布偏移下的显著性能差距。
The last decade has witnessed a prosperous development of computational methods and dataset curation for AI-aided drug discovery (AIDD). However, real-world pharmaceutical datasets often exhibit highly imbalanced distribution, which is overlooked by the current literature but may severely compromise the fairness and generalization of machine learning applications. Motivated by this observation, we introduce ImDrug, a comprehensive benchmark with an open-source Python library which consists of 4 imbalance settings, 11 AI-ready datasets, 54 learning tasks and 16 baseline algorithms tailored for imbalanced learning. It provides an accessible and customizable testbed for problems and solutions spanning a broad spectrum of the drug discovery pipeline such as molecular modeling, drug-target interaction and retrosynthesis. We conduct extensive empirical studies with novel evaluation metrics, to demonstrate that the existing algorithms fall short of solving medicinal and pharmaceutical challenges in the data imbalance scenario. We believe that ImDrug opens up avenues for future research and development, on real-world challenges at the intersection of AIDD and deep imbalanced learning.
研究动机与目标
- 解决在人工智能辅助药物发现(AIDD)中广泛存在但被忽视的真实药物数据集类别不平衡问题。
- 为评估多样化AIDD任务中的深度类别不平衡学习算法,提供一个标准化、可访问且可定制的基准。
- 评估传统指标(如准确率和AUROC)在不平衡分布下的局限性,并提出更稳健的替代指标。
- 研究现有模型在分布外(OOD)和长尾数据划分下的性能退化情况,以反映真实世界药物发现的挑战。
- 通过揭示当前算法在实际AIDD场景中的不足,推动类别不平衡学习领域的创新。
提出的方法
- ImDrug 构建了一个基准,包含11个涵盖分子建模、药物-靶标相互作用和逆合成的AI就绪数据集,每个数据集包含多个学习任务。
- 实施了四种不平衡设置:标准不平衡分类、开放长尾分类、不平衡回归和长尾识别。
- 该基准包含16种基线算法,分为三类:类别重平衡、数据增强和模块改进。
- 引入了五种新型数据划分函数——骨架划分、时间划分及其他类型,以模拟现实的分布外(OOD)场景,实现更稳健的评估。
- ImDrug 提出并评估了新指标:平衡准确率和平衡F1分数,结果表明这些指标与平衡测试集上的黄金标准AUROC具有强相关性。
- 通过皮尔逊相关性分析进行实证评估,验证了所提指标在不平衡测试集上相对于标准指标的可靠性。
实验结果
研究问题
- RQ1ImDrug 是否能作为人工智能辅助药物发现中现实挑战(尤其是数据不平衡和分布偏移)的有意义代理?
- RQ2在AIDD的高不平衡测试集中,传统评估指标(如准确率和AUROC)是否仍保持可靠性和敏感性?
- RQ3现有深度学习基线在AIDD数据集的真实分布外(OOD)划分(如骨架划分和时间划分)下表现如何?
- RQ4所提出的平衡指标(平衡准确率和F1)在平衡测试集上与黄金标准AUROC的相关程度如何?
- RQ5标准划分与OOD划分之间的性能差距有多大?这些差距是否揭示了当前类别不平衡学习方法在AIDD中存在根本性局限?
主要发现
- 分布外划分(尤其是骨架划分和时间划分)在平衡准确率上平均导致1.22%的性能下降,在MAE上则增加2.03%,表明在真实世界分布偏移下存在显著性能退化。
- 准确率在平衡测试集上与AUROC的相关性较弱(皮尔逊相关系数 R = 0.2092),表明其在不平衡数据上过于乐观且不可靠。
- 在不平衡测试集上,平衡准确率与所提出的平衡F1分数之间表现出近乎完美的一致性(皮尔逊相关系数 R = 0.9999),验证了其作为评估指标的可靠性。
- 在标准平衡划分上,AUROC与在不平衡随机划分上的平衡准确率之间存在中等程度相关性(R = 0.4364),表明AUROC仍是更稳定的黄金标准。
- 该基准揭示,现有算法在处理AIDD中的真实世界不平衡和OOD场景时表现不足,凸显了对更优方法的迫切需求。
- ImDrug 的开源平台和多样化划分函数,使得在药物发现中对类别不平衡学习模型的评估更加真实且统计稳健。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。