Skip to main content
QUICK REVIEW

[论文解读] Explainable Deep Relational Networks for Predicting Compound-Protein Affinities and Contacts

Mostafa Karimi, Di Wu|arXiv (Cornell University)|Dec 29, 2019
Computational Drug Discovery Methods参考文献 44被引用 5
一句话总结

本文提出 DeepRelations,一种受物理启发、内在可解释的深度关系网络,通过显式建模物理相互作用,联合预测化合物-蛋白亲和力与原子级接触。该方法在不损失亲和力预测准确率的前提下,实现了最先进水平的可解释性——接触预测的 AUPRC 提升最高达 19.3 倍,得益于结构化注意力正则化和监督接触信号。

ABSTRACT

Predicting compound-protein affinity is critical for accelerating drug discovery. Recent progress made by machine learning focuses on accuracy but leaves much to be desired for interpretability. Through molecular contacts underlying affinities, our large-scale interpretability assessment finds commonly-used attention mechanisms inadequate. We thus formulate a hierarchical multi-objective learning problem whose predicted contacts form the basis for predicted affinities. We further design a physics-inspired deep relational network, DeepRelations, with intrinsically explainable architecture. Specifically, various atomic-level contacts or "relations" lead to molecular-level affinity prediction. And the embedded attentions are regularized with predicted structural contexts and supervised with partially available training contacts. DeepRelations shows superior interpretability to the state-of-the-art: without compromising affinity prediction, it boosts the AUPRC of contact prediction 9.5, 16.9, 19.3 and 5.7-fold for the test, compound-unique, protein-unique, and both-unique sets, respectively. Our study represents the first dedicated model development and systematic model assessment for interpretable machine learning of compound-protein affinity.

研究动机与目标

  • 弥合深度学习模型在化合物-蛋白亲和力预测中可解释性的关键空白,这对理性药物发现至关重要。
  • 指出标准注意力机制无法恢复支撑亲和力的生物上有意义的原子接触,从而限制其可解释性。
  • 开发一种新颖的深度关系架构,将原子级相互作用(如氢键、疏水接触)建模为显式的、受物理启发的关系,实现内在可解释性。
  • 提出一种分层多目标学习框架,逐步聚焦于相关蛋白表面、残基及残基-原子对。
  • 利用真实接触注释系统评估可解释性,并在分布外化合物和蛋白上验证其鲁棒性。

提出的方法

  • 设计一种分层多阶段架构,在逐步增加的粒度级别上建模化合物-蛋白相互作用:从蛋白表面和二级结构,到残基-原子接触对。
  • 对多种类型的原子级关系(如氢键、范德华力)的残基-原子对联合注意力进行嵌入,注意力权重由预测的结构上下文(如表面积可及性、残基接触图)正则化。
  • 引入部分可用的真实接触注释作为弱监督,引导注意力学习,提升与实际分子相互作用的一致性。
  • 使用图神经网络(GNNs)编码化合物结构和蛋白序列,通过原子和残基级表示进行消息传递。
  • 采用联合亲和力预测与接触预测的多目标损失端到端训练模型,实现两个任务的联合优化。
  • 当缺乏三维结构时,利用最先进蛋白结构预测模型(如二级结构和接触图预测)生成结构先验。

实验结果

研究问题

  • RQ1仅靠注意力机制能否可靠恢复支撑化合物-蛋白亲和力的生物上有意义的原子接触?
  • RQ2如何利用已知分子相互作用系统性地定义并评估化合物-蛋白亲和力预测中的可解释性?
  • RQ3受物理启发的关系归纳偏置在多大程度上能提升深度学习模型在药物发现中的可解释性?
  • RQ4联合训练亲和力与接触预测的模型能否在不降低预测准确率的前提下实现更优的可解释性?
  • RQ5所提出模型的可解释性在训练过程中未见的化合物和蛋白上具有多大泛化能力?

主要发现

  • DeepRelations 显著提升了接触预测的可解释性,在默认测试集上相比最佳基线(HRNN-GCN 联合注意力)的 AUPRC 提升了 9.48 倍。
  • 在蛋白独有测试集中,AUPRC 最高提升达 19.28 倍,表明对未见蛋白具有强大的泛化能力。
  • 在所有测试集中,前 50 名预测接触中,33% 至 39% 位于真实原子接触的 10Å 范围内,表明预测相互作用具有较高的空间准确性。
  • 消融研究证实,显式物理关系的关联架构是性能提升的主要驱动力,而非单纯的注意力正则化或监督。
  • 即使在分布外化合物和蛋白上,模型仍保持高性能,且在化合物独有和蛋白独有设置中,可解释性增益进一步提升。
  • 案例研究显示,DeepRelations 预测出更具生物合理性和规律性的接触图,许多“错误”预测也落在真实接触的合理空间距离内(≤10Å)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。