Skip to main content
QUICK REVIEW

[论文解读] DiffDock-PP: Rigid Protein-Protein Docking with Diffusion Models

Mohamed Amine Ketata, Cedrik Laue|arXiv (Cornell University)|Apr 8, 2023
Protein Structure and Dynamics被引用 26
一句话总结

DiffDock-PP 将刚性蛋白-蛋白对接表述为扩散生成问题,用于采样姿态并用学习到的置信度模型进行排序,在 DIPS 上实现行业领先的性能,并且比多数基线具有更快的运行时间。

ABSTRACT

Understanding how proteins structurally interact is crucial to modern biology, with applications in drug discovery and protein design. Recent machine learning methods have formulated protein-small molecule docking as a generative problem with significant performance boosts over both traditional and deep learning baselines. In this work, we propose a similar approach for rigid protein-protein docking: DiffDock-PP is a diffusion generative model that learns to translate and rotate unbound protein structures into their bound conformations. We achieve state-of-the-art performance on DIPS with a median C-RMSD of 4.85, outperforming all considered baselines. Additionally, DiffDock-PP is faster than all search-based methods and generates reliable confidence estimates for its predictions. Our code is publicly available at $ exttt{https://github.com/ketatam/DiffDock-PP}$

研究动机与目标

  • 将刚性体蛋白-蛋白对接建模为一个生成任务,以捕捉多模态的姿态分布。
  • 开发基于扩散的模型,将配体姿态(一个蛋白相对另一个蛋白)映射到刚性运动的六自由度流形上。
  • 利用 SE(3) 等变架构及与蛋白对称性和刚性兼容的内在扩散框架。
  • 训练一个置信度模型,通过接近真实答案的可能性对生成的姿态进行排序,并选取最佳姿态。
  • 在 DIPS 上展示行业领先的性能,并比传统基于搜索的对接方法实现显著加速。

提出的方法

  • 将蛋白质建模为残基级图,并具备 SE(3)-等变分数和置信度网络。
  • 在平移和三维旋转的乘积空间上定义扩散,以在给定受体的条件下采样配体姿态。
  • 在 T(3) 和 SO(3) 上使用前向扩散,其分数在各自的切空间中以生成姿态。
  • 使用本征流形上的去噪分数匹配进行训练,并在推理时采用低温采样以实现模式的集中。
  • 训练一个单独的置信度模型来预测采样的姿态是否具有低于 5Å 阈值的 L-RMSD,并按此置信度对姿态进行排序。
  • 输出扩散样本中预测置信度最高的姿态。

实验结果

研究问题

  • RQ1扩散生成模型是否可以有效逼近刚性体蛋白-蛋白对接的姿态分布?
  • RQ2采用基于学习置信度的多姿态采样并排序,是否比单次预测或传统对接基线产生更好的对接结构?
  • RQ3与在 DIPS 上的最先进对接方法相比,DiffDock-PP 的效率与准确性权衡是什么?
  • RQ4在平移与旋转乘积空间上的内在扩散是否能提高刚性对接任务的泛化能力?

主要发现

  • 在 DIPS 上,DiffDock-PP 在 40 次采样时达到中位 Complex RMSD (C-RMSD) 4.85,优于所有基线。
  • 在 40 次采样下,DiffDock-PP 的复杂 RMSD 为 C-RMSD < 2Å 的预测占比为 42%,< 5Å 的为 50%,以及 I-RMSD 的 45% 和 52%,中位 I-RMSD 为 4.23
  • DiffDock-PP 在 GPU 上比常见基于搜索的对接软件快 5 到 60 倍。
  • 即使每个复合体只有一个样本,DiffDock-PP 仍然优于大多数基线,同时保持较低的运行时间。
  • 类 Oracle 的选择(完美挑选最佳样本)在上限上带来显著提升,例如在 40-样本 Oracle 设置下的 0.67% C-RMSD 和 0.54% I-RMSD。
  • 当通过置信度模型对预测进行筛选时,模型性能提升,表明对提出的姿态排序有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。