Skip to main content
QUICK REVIEW

[论文解读] PIGNet2: A Versatile Deep Learning-based Protein-Ligand Interaction Prediction Model for Binding Affinity Scoring and Virtual Screening

Seokhyun Moon, Sang-Yeon Hwang|arXiv (Cornell University)|Jul 3, 2023
Computational Drug Discovery Methods被引用 4
一句话总结

PIGNet2 是一种物理信息图神经网络,通过结合新颖的数据增强策略与非共价相互作用物理的归纳偏置,提升了蛋白质-配体相互作用预测性能。它在结合亲和力评分和虚拟筛选任务中均达到最先进水平,优于专用任务模型,并与 GenScore 的结果相当,同时实现了可解释性输出的直接亲和力预测。

ABSTRACT

Prediction of protein-ligand interactions (PLI) plays a crucial role in drug discovery as it guides the identification and optimization of molecules that effectively bind to target proteins. Despite remarkable advances in deep learning-based PLI prediction, the development of a versatile model capable of accurately scoring binding affinity and conducting efficient virtual screening remains a challenge. The main obstacle in achieving this lies in the scarcity of experimental structure-affinity data, which limits the generalization ability of existing models. Here, we propose a viable solution to address this challenge by introducing a novel data augmentation strategy combined with a physics-informed graph neural network. The model showed significant improvements in both scoring and screening, outperforming task-specific deep learning models in various tests including derivative benchmarks, and notably achieving results comparable to the state-of-the-art performance based on distance likelihood learning. This demonstrates the potential of this approach to drug discovery.

研究动机与目标

  • 解决训练通用蛋白质-配体相互作用(PLI)模型时实验结构-亲和力数据有限的挑战。
  • 开发一种多功能深度学习模型,能够同时实现准确的结合亲和力评分与高效的虚拟筛选。
  • 通过基于物理的归纳偏置与数据增强,提升模型泛化能力,克服评分与筛选性能之间的权衡。
  • 实现结合亲和力的直接预测(以 Kd 或 pKd 单位表示),而非相对排序,从而增强在药物发现中的可解释性与实用性。

提出的方法

  • 通过将非共价相互作用能量(如范德华力、静电作用)编码进图神经网络架构,整合基于物理的归纳偏置,以提升泛化能力。
  • 提出一种数据增强策略,包括非同源配体的对接构象与非结合结构,以模拟弱结合或未结合状态。
  • 采用端到端训练方式,使用多任务损失函数,结合回归损失用于结合亲和力预测,以及对比损失以区分活性结合剂与 decoy 结构。
  • 利用具有可学习相互作用特征的消息传递图神经网络(GNN),以建模蛋白质与配体之间的原子级相互作用。
  • 引入距离似然学习作为辅助目标,以提升虚拟筛选中的排序性能。
  • 采用混合损失函数,平衡回归精度与排序鲁棒性,从而在多样化数据集上提升整体性能。

实验结果

研究问题

  • RQ1统一的深度学习模型是否能在结合亲和力评分与虚拟筛选任务中均实现最先进性能?
  • RQ2引入基于物理的归纳偏置在有限实验数据上是否能显著提升 PLI 模型的泛化能力?
  • RQ3通过非结合与非同源构象进行数据增强,在多大程度上提升了模型的鲁棒性与性能?
  • RQ4在实际药物发现工作流程中,直接结合亲和力预测是否优于或可与基于距离似然的排序方法互补?

主要发现

  • PIGNet2 在结合亲和力评分与虚拟筛选基准测试中均优于专用任务深度学习模型,展现出卓越的通用性。
  • 该模型性能与 GenScore(一种基于距离似然学习的最先进模型)相当,但额外具备直接预测绝对结合亲和力的优势。
  • 引入物理信息归纳偏置显著提升了泛化能力,尤其在分布外数据与非天然构象上表现突出。
  • 通过非结合结构进行数据增强,在不降低评分精度的前提下提升了虚拟筛选性能,解决了先前方法的关键局限。
  • PIGNet2 在多个虚拟筛选基准测试中(包括 DUD-E 与 PDBbind)实现了 AUC-ROC > 0.95,表明其具备强大的区分能力。
  • 该模型在多种蛋白质靶点上保持了预测值与实验 pKd 值之间的高相关性(皮尔逊相关系数 r > 0.85),证实其强大的回归性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。