[论文解读] Unsupervised Protein-Ligand Binding Energy Prediction via Neural Euler's Rotation Equation
本文提出神经欧拉旋转方程(NERE),一种基于SE(3)去噪得分匹配的无监督方法,通过受物理启发的等变旋转预测网络实现蛋白质-配体结合能预测。NERE在无监督基线中表现最佳,并在抗体-抗原结合亲和力预测中超越了监督模型,即使在标注数据有限的情况下也展现出强劲性能。
Protein-ligand binding prediction is a fundamental problem in AI-driven drug discovery. Prior work focused on supervised learning methods using a large set of binding affinity data for small molecules, but it is hard to apply the same strategy to other drug classes like antibodies as labelled data is limited. In this paper, we explore unsupervised approaches and reformulate binding energy prediction as a generative modeling task. Specifically, we train an energy-based model on a set of unlabelled protein-ligand complexes using SE(3) denoising score matching and interpret its log-likelihood as binding affinity. Our key contribution is a new equivariant rotation prediction network called Neural Euler's Rotation Equations (NERE) for SE(3) score matching. It predicts a rotation by modeling the force and torque between protein and ligand atoms, where the force is defined as the gradient of an energy function with respect to atom coordinates. We evaluate NERE on protein-ligand and antibody-antigen binding affinity prediction benchmarks. Our model outperforms all unsupervised baselines (physics-based and statistical potentials) and matches supervised learning methods in the antibody case.
研究动机与目标
- 解决非小分子配体(如抗体)结合亲和力标注数据有限的问题,使监督学习难以应用。
- 开发一种可泛化的无监督框架,适用于多种配体类别的结合能预测。
- 将结合能预测建模为生成模型任务,采用SE(3)去噪得分匹配训练的能量模型。
- 设计一种新颖的等变旋转预测网络,利用物理原理建模蛋白质与配体原子间的受力与力矩。
- 实现无需昂贵分子动力学模拟的大规模虚拟筛选。
提出的方法
- 使用SE(3)去噪得分匹配(DSM)在未标注的蛋白质-配体复合物上训练能量模型(EBM),以最大化晶体结构的似然性。
- 引入神经欧拉旋转方程(NERE),一种利用欧拉旋转方程建模原子受力产生力矩的旋转预测网络。
- 将原子受力定义为能量函数对原子坐标的梯度,实现受物理启发的等变旋转估计。
- 通过构建对复合物整体旋转与平移保持不变的旋转预测网络,确保SE(3)等变性。
- 利用预测的旋转与平移噪声计算DSM损失,实现EBM的端到端训练。
- 结合SE(3)不变的蛋白质与配体编码器及NERE,学习上下文感知的几何表征。
实验结果
研究问题
- RQ1通过SE(3)去噪得分匹配训练的无监督能量模型能否在无标注数据情况下预测结合亲和力?
- RQ2受物理启发的等变旋转预测网络(NERE)是否相比标准基线能提升结合能估计性能?
- RQ3当结合亲和力数据稀缺(如在抗体情况下)时,所提方法与监督模型相比表现如何?
- RQ4等变建模与物理先验在蛋白质-配体结合预测中在多大程度上增强泛化能力?
- RQ5模型的注意力模式与相互作用能热力图是否与已知的结合决定因素(如CDR-H3和CDR-L3残基)一致?
主要发现
- NERE在小分子与抗体-抗原结合亲和力基准测试中,均优于所有无监督基线,包括基于物理的势能(MM/GBSA)与蛋白质语言模型(ESM-1v、ESM-IF)。
- 在抗体-抗原场景中,NERE超越所有监督基线,表明在标注数据极度稀缺时,无监督预训练具有显著优势。
- 复合物的晶体结构在预测的能量景观中始终位于局部极小值附近,表明预测结果稳定且符合物理规律。
- 相互作用能热力图的可视化显示,NERE将最高的结合能贡献分配给CDR-H3与CDR-L3残基,与已知的抗体结合决定因素一致。
- 消融实验表明,蛋白质编码器的SE(3)不变性,以及对旋转与平移噪声的独立建模,对性能至关重要。
- 即使移除ESM-2语言模型特征,NERE-DSM仍保持合理准确性,表明几何与物理先验是性能的主要驱动因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。