Skip to main content
QUICK REVIEW

[论文解读] SS-GNN: A Simple-Structured Graph Neural Network for Affinity Prediction

Shuke Zhang, Yanzhao Jin|arXiv (Cornell University)|May 25, 2022
Computational Drug Discovery Methods被引用 7
一句话总结

SS-GNN 是一种轻量级、结构简单的图神经网络,通过使用距离阈值从蛋白-配体复合物构建单一无向图来预测药物-靶标结合亲和力,忽略共价键以降低计算成本。其在 PDBbind v2016 核心集上的皮尔逊相关系数达到 0.853,性能优于现有基于 GNN 的方法 5.2%,同时保持了高效率(每次预测仅需 0.2 ms)。

ABSTRACT

Efficient and effective drug-target binding affinity (DTBA) prediction is a challenging task due to the limited computational resources in practical applications and is a crucial basis for drug screening. Inspired by the good representation ability of graph neural networks (GNNs), we propose a simple-structured GNN model named SS-GNN to accurately predict DTBA. By constructing a single undirected graph based on a distance threshold to represent protein-ligand interactions, the scale of the graph data is greatly reduced. Moreover, ignoring covalent bonds in the protein further reduces the computational cost of the model. The GNN-MLP module takes the latent feature extraction of atoms and edges in the graph as two mutually independent processes. We also develop an edge-based atom-pair feature aggregation method to represent complex interactions and a graph pooling-based method to predict the binding affinity of the complex. We achieve state-of-the-art prediction performance using a simple model (with only 0.6M parameters) without introducing complicated geometric feature descriptions. SS-GNN achieves Pearson's Rp=0.853 on the PDBbind v2016 core set, outperforming state-of-the-art GNN-based methods by 5.2%. Moreover, the simplified model structure and concise data processing procedure improve the prediction efficiency of the model. For a typical protein-ligand complex, affinity prediction takes only 0.2 ms. All codes are freely accessible at https://github.com/xianyuco/SS-GNN.

研究动机与目标

  • 为药物发现中的高效且准确的药物-靶标结合亲和力(DTBA)预测提供解决方案。
  • 通过简化图表示并消除对共价键的依赖,降低基于 GNN 的 DTBA 模型的计算复杂度。
  • 开发一种轻量级模型,在不依赖复杂几何特征或人工设计特征的情况下保持高预测性能。
  • 在实现最先进准确度的同时,提升大规模分子对接应用的预测效率。
  • 通过简化架构和基于边的特征聚合方法,实现在有限训练数据下的有效学习。

提出的方法

  • 使用距离阈值定义相互作用,从蛋白-配体复合物构建单一无向图,以减小图规模和计算负载。
  • 在蛋白中排除共价键,进一步降低计算成本,同时保留关键的非共价相互作用。
  • 采用 GNN-MLP 模块,独立学习图中原子和边的潜在特征,实现高效的消息传递。
  • 提出一种基于边的原子对特征聚合方法,用于表示复合物中复杂的多原子相互作用。
  • 使用基于图池化的回归头,直接从图级表示预测结合亲和力。
  • 采用基于图同构网络(GIN)的编码器,以极少参数(0.6M)实现鲁棒的节点和边表征学习。

实验结果

研究问题

  • RQ1基于距离阈值的简化图表示是否能有效捕捉用于结合亲和力预测的关键蛋白-配体相互作用?
  • RQ2在蛋白结构中排除共价键是否能显著降低计算成本而不损害预测性能?
  • RQ3具有最小架构复杂度的轻量级 GNN 架构能否在 DTBA 预测中超越更复杂的最先进 GNN 模型?
  • RQ4所提出的基于边的原子对特征聚合方法相比标准 GNN 消息传递,在建模复杂相互作用方面有何改进?
  • RQ5该模型的效率(推理时间)在大规模虚拟筛选应用中可扩展到何种程度?

主要发现

  • SS-GNN 在 PDBbind v2016 核心集上的皮尔逊相关系数达到 0.853,相较于最佳现有基于 GNN 的方法相对提升了 5.2%。
  • 该模型仅使用 0.6 百万个参数即达到最先进性能,展现出高效率和强大的泛化能力。
  • 对于典型的蛋白-配体复合物,亲和力预测仅需 0.2 ms,显著优于其他方法(如 HPC/HWPC 每样本需 12,000 ms)。
  • SS-GNN 在训练数据有限的情况下仍保持强劲性能,表明其在低数据场景下具备有效的特征学习能力。
  • 该模型在包括 Pafnucy、K_{Deep}、IGN 和 FAST 在内的多个最先进方法中表现更优,尤其在包含 15,394 个训练样本的一般数据集上。
  • 简化的图表示和简洁的处理流程实现了高速推理,使 SS-GNN 适用于大规模虚拟筛选。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。