Skip to main content
QUICK REVIEW

[论文解读] Artificial Intelligence in Drug Discovery: Applications and Techniques

Jianyuan Deng, Zhibo Yang|arXiv (Cornell University)|Jun 9, 2021
Computational Drug Discovery Methods参考文献 230被引用 8
一句话总结

本综述全面概述了人工智能(AI)在小分子药物发现中的应用,重点聚焦于分子性质预测与分子生成。系统性地回顾了数据资源、分子表征方式、基准平台、模型架构(如图神经网络GNNs、变换器Transformers)以及学习范式(监督学习、自监督学习、强化学习),对技术进展进行了时间序列分析,并指出了数据稀缺性、模型可解释性以及缺乏标准化评估协议等挑战。

ABSTRACT

Artificial intelligence (AI) has been transforming the practice of drug discovery in the past decade. Various AI techniques have been used in a wide range of applications, such as virtual screening and drug design. In this survey, we first give an overview on drug discovery and discuss related applications, which can be reduced to two major tasks, i.e., molecular property prediction and molecule generation. We then discuss common data resources, molecule representations and benchmark platforms. Furthermore, to summarize the progress of AI in drug discovery, we present the relevant AI techniques including model architectures and learning paradigms in the papers surveyed. We expect that this survey will serve as a guide for researchers who are interested in working at the interface of artificial intelligence and drug discovery. We also provide a GitHub repository (https://github.com/dengjianyuan/Survey_AI_Drug_Discovery) with the collection of papers and codes, if applicable, as a learning resource, which is regularly updated.

研究动机与目标

  • 提供对应用于小分子药物发现的AI技术的系统性综述,重点聚焦于预测与生成任务。
  • 识别并分析AI驱动药物发现中使用的关键数据资源、分子表征方式与基准平台。
  • 考察AI在药物发现中模型架构与学习范式的演变,从传统机器学习到深度学习及自监督方法。
  • 突出持续存在的挑战,如数据稀缺性、模型可解释性以及缺乏标准化评估协议。
  • 通过维护一个定期更新的GitHub代码库,为研究者提供一个精选的学习资源。

提出的方法

  • 将药物发现中的AI应用划分为两大核心任务:分子性质预测与分子生成。
  • 调查并整理现有数据集,包括PubChem和ZINC,并评估其在训练与基准测试中的实用性。
  • 回顾分子表征方式,如SMILES、指纹(例如ECFP)以及基于图的编码(例如GNNs)。
  • 分析卷积神经网络(CNNs)、循环神经网络(RNNs)、图神经网络(GNNs)和变换器在分子建模中的模型架构。
  • 考察监督学习、自监督预训练以及强化学习等学习范式在药物设计中的应用。
  • 提供一个GitHub代码库,汇集精选论文与代码,以支持该领域的持续研究与教育。

实验结果

研究问题

  • RQ1过去十年中,AI技术在分子性质预测与分子生成中的应用如何演变?
  • RQ2在AI驱动的药物发现中,最广泛使用的数据资源、分子表征方式与基准平台是什么?
  • RQ3不同模型架构(如GNNs、变换器)与学习范式(如自监督学习)在性能与适用性方面如何比较?
  • RQ4哪些关键挑战阻碍了AI在药物发现中的实际应用,特别是数据质量、模型可解释性与评估标准化方面?
  • RQ5真实世界数据(如电子健康记录EHR、DrugBank)如何为AI驱动药物设计中的假设生成提供信息并加以改进?

主要发现

  • 尽管深度学习兴起,但在某些分子性质预测任务中,固定指纹(如ECFP)仍优于GNN生成的表征。
  • 自监督学习与强化学习范式在分子生成中日益被采用,实现了对化学空间更高效的探索。
  • 数据稀缺性与类别不平衡仍是关键挑战,许多基准数据集在每个检测任务中数据点有限,且代表性存疑。
  • 模型可解释性仍是主要限制,亟需可解释AI技术以支持透明性、可解释性、信息量与不确定性估计。
  • 各研究之间缺乏标准化协议,包括数据划分不一致、评估指标(如AUPRC与AUROC)不统一以及超参数调优流程不一致。
  • 真实世界数据源(如电子健康记录与DrugBank)正逐渐成为生成假设与提升药物设计洞察力的宝贵工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。