[论文解读] Protein-ligand binding representation learning from fine-grained interactions
该论文提出 BindNet,一种自监督学习框架,通过基于 Transformer 的交互模块,从口袋结构和配体预测最终复合物结构,实现对蛋白质-配体结合的建模。通过引入原子对距离图预测和掩码配体重建预训练目标,BindNet 学习到细粒度的相互作用表征,在亲和力预测、虚拟筛选和对接任务中均达到最先进性能,并展现出对分布外结构的强大泛化能力。
The binding between proteins and ligands plays a crucial role in the realm of drug discovery. Previous deep learning approaches have shown promising results over traditional computationally intensive methods, but resulting in poor generalization due to limited supervised data. In this paper, we propose to learn protein-ligand binding representation in a self-supervised learning manner. Different from existing pre-training approaches which treat proteins and ligands individually, we emphasize to discern the intricate binding patterns from fine-grained interactions. Specifically, this self-supervised learning problem is formulated as a prediction of the conclusive binding complex structure given a pocket and ligand with a Transformer based interaction module, which naturally emulates the binding process. To ensure the representation of rich binding information, we introduce two pre-training tasks, i.e.~atomic pairwise distance map prediction and mask ligand reconstruction, which comprehensively model the fine-grained interactions from both structure and feature space. Extensive experiments have demonstrated the superiority of our method across various binding tasks, including protein-ligand affinity prediction, virtual screening and protein-ligand docking.
研究动机与目标
- 为解决监督深度学习模型在蛋白质-配体结合任务中泛化能力有限的问题,利用自监督表征学习。
- 克服现有预训练方法仅关注单个蛋白质和配体编码器而非结合相互作用模式的不足。
- 开发一种显式建模对结合亲和力和构象预测至关重要的细粒度原子级相互作用的表征学习框架。
- 通过学习与特定复合物构象无关的相互作用感知表征,提升在分布外设置下的鲁棒性。
- 通过统一的、相互作用感知的表征,实现跨多样化结合任务(如亲和力预测、虚拟筛选和对接)的迁移学习。
提出的方法
- 将自监督预训练表述为复合物结构预测任务:给定蛋白质口袋和配体,预测最终结合的复合物结构。
- 采用基于 Transformer 的交互模块,关注口袋与配体之间的原子对相互作用,同时使用固定的蛋白质和配体编码器。
- 引入原子对距离图预测(ADP),以监督蛋白质和配体原子之间细粒度的空间相互作用模式。
- 提出掩码配体重建(MLR),通过在特征空间中掩码并重建配体表征,学习化学和三维形状特征。
- 采用多任务预训练,结合 ADP 和 MLR,联合优化结构和语义相互作用知识。
- 通过微调将学习到的表征应用于下游任务,无需重新训练交互模块。
实验结果
研究问题
- RQ1将结合过程建模为复合物结构预测的自监督学习是否能提升蛋白质-配体相互作用的表征质量?
- RQ2聚焦于细粒度原子相互作用的预训练目标(ADP 和 MLR)是否优于聚焦于单个分子的预训练目标?
- RQ3通过 BindNet 学习到的相互作用感知表征是否能泛化到预训练中未见的分布外复合物构象?
- RQ4BindNet 在亲和力预测、虚拟筛选和对接任务中与监督方法及现有预训练方法相比表现如何?
- RQ5ADP 和 MLR 预训练目标在学习鲁棒且全面的结合表征方面,其互补性在多大程度上得到体现?
主要发现
- 在所有分布内和分布外设置下,BindNet 在蛋白质-配体亲和力预测中均优于监督基线模型(Atom3D-CNN、Atom3D-GNN)和现有预训练方法(Uni-Mol)。
- 在分布外设置(RR:RDKit 生成的构象)中,BindNet 保持低 RMSE(1.601)和高 AUPRC(0.78),显著优于 Atom3D-GNN(RMSE:12.475,AUPRC:0.42)和 Uni-Mol(RMSE:2.15,AUPRC:0.72)。
- 消融实验表明,结合 ADP 和 MLR 预训练可获得最佳性能,二者分别提供互补知识:ADP 捕获空间相互作用模式,MLR 增强化学和形状表征学习。
- BindNet 在虚拟筛选任务中表现达到最先进水平,LBA 数据集上 AUPRC 为 0.78,DUD-E 数据集上为 0.75,优于 Uni-Mol 和监督模型。
- 该模型在对接任务中展现出强大泛化能力,对测试数据中的构象变化具有鲁棒性,尤其在 CD 和 RR 设置下表现突出。
- 结合 ADP 和 MLR 的多任务预训练使 AUPRC 相比单目标预训练提升 15-20%,证实了在相互作用感知信号上联合优化的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。