[论文解读] Structure-based drug discovery with deep learning
本综述整合了基于结构的药物发现(SBDD)中深度学习方法的最新进展,重点在于蛋白质结构的融合,以预测药物-靶标相互作用、识别结合位点,并实现从头分子设计。它强调几何深度学习和扩散模型作为变革性方法,同时指出数据稀缺性和模型可解释性是实现真实世界应用的关键挑战。
Artificial intelligence (AI) in the form of deep learning bears promise for drug discovery and chemical biology, $ extit{e.g.}$, to predict protein structure and molecular bioactivity, plan organic synthesis, and design molecules $ extit{de novo}$. While most of the deep learning efforts in drug discovery have focused on ligand-based approaches, structure-based drug discovery has the potential to tackle unsolved challenges, such as affinity prediction for unexplored protein targets, binding-mechanism elucidation, and the rationalization of related chemical kinetic properties. Advances in deep learning methodologies and the availability of accurate predictions for protein tertiary structure advocate for a $ extit{renaissance}$ in structure-based approaches for drug discovery guided by AI. This review summarizes the most prominent algorithmic concepts in structure-based deep learning for drug discovery, and forecasts opportunities, applications, and challenges ahead.
研究动机与目标
- 综述将蛋白质结构信息整合到药物发现中的最先进深度学习方法。
- 识别在数据可用性、模型泛化能力和可解释性方面,基于结构的人工智能应用所面临的关键挑战。
- 突出几何深度学习和扩散模型等新兴技术在分子生成和相互作用预测中的应用。
- 评估当前计算机模拟预测与前瞻性实验验证在SBDD中的差距。
- 倡导采用可解释人工智能和改进的数据整理方法,弥合计算模型与实验药物化学之间的鸿沟。
提出的方法
- 采用图神经网络(GNNs)、卷积神经网络(CNNs)和几何深度学习等深度学习架构,对三维分子结构和蛋白质-配体相互作用进行建模。
- 应用几何深度学习,以编码三维分子表示中的旋转-平移不变性和对称性,提升在多样化蛋白质靶标上的泛化能力。
- 采用生成式深度学习,特别是扩散模型,实现基于靶标蛋白质结构的从头分子设计。
- 整合来自AlphaFold等高精度预测器的蛋白质三级结构,以增强结合亲和力和相互作用预测的准确性。
- 利用从原始分子表示(如SMILES、三维坐标)端到端学习,避免人工特征工程。
- 提出数据整理、偏差校正和多模态学习策略,以应对药物-靶标相互作用预测中不平衡且低质量的三维数据集问题。
实验结果
研究问题
- RQ1深度学习如何有效建模复杂的三维蛋白质-配体相互作用,以实现药物-靶标亲和力的预测?
- RQ2几何深度学习和对称性感知架构在提升多样化蛋白质靶标间泛化能力方面发挥何种作用?
- RQ3基于扩散的生成模型在实现具有特定结合模式的生物活性分子从头设计方面,其潜力有多大?
- RQ4在基于结构的深度学习药物发现中,主要的数据相关障碍是什么,限制了模型性能和泛化能力?
- RQ5可解释人工智能方法如何增强对深度学习预测结果的信任,并促进其在SBDD中的实验验证?
主要发现
- 几何深度学习和对称性感知架构通过编码旋转-平移不变性,显著提升了对三维分子系统的建模能力,减少搜索空间并增强泛化性能。
- 扩散模型在分子生成任务中已达到最先进水平,并在具有结构约束的从头药物设计中展现出强大潜力。
- 尽管已有进展,但目前尚无基于结构的药物发现深度学习模型在前瞻性实验环境中得到验证,凸显了实际应用中的关键差距。
- 高质量的共晶化三维蛋白质-配体复合物仍然稀缺,导致数据集存在偏差,限制了模型在新靶标上的泛化能力和性能。
- 当前模型往往低估非结合和弱结合分子,加剧了数据不平衡问题,降低了选择性与活性悬崖检测的预测可靠性。
- 可解释人工智能技术对于解码黑箱预测结果、揭示构效关系至关重要,有助于与实验药物化学工作流程实现整合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。