[论文解读] From Static to Dynamic Structures: Improving Binding Affinity Prediction with Graph-Based Deep Learning
该论文提出Dynaformer,一种基于图的深度学习模型,通过利用分子动力学(MD)轨迹捕捉动态结构集合,提升了蛋白质-配体结合亲和力预测性能,在CASF-2016数据集上表现优于基于静态结构的方法,并在HSP90虚拟筛选中成功识别出12种命中化合物,包括具有亚微摩尔亲和力的新骨架结构。
Accurate prediction of protein-ligand binding affinities is an essential challenge in structure-based drug design. Despite recent advances in data-driven methods for affinity prediction, their accuracy is still limited, partially because they only take advantage of static crystal structures while the actual binding affinities are generally determined by the thermodynamic ensembles between proteins and ligands. One effective way to approximate such a thermodynamic ensemble is to use molecular dynamics (MD) simulation. Here, an MD dataset containing 3,218 different protein-ligand complexes is curated, and Dynaformer, a graph-based deep learning model is further developed to predict the binding affinities by learning the geometric characteristics of the protein-ligand interactions from the MD trajectories. In silico experiments demonstrated that the model exhibits state-of-the-art scoring and ranking power on the CASF-2016 benchmark dataset, outperforming the methods hitherto reported. Moreover, in a virtual screening on heat shock protein 90 (HSP90) using Dynaformer, 20 candidates are identified and their binding affinities are further experimentally validated. Dynaformer displayed promising results in virtual drug screening, revealing 12 hit compounds (two are in the submicromolar range), including several novel scaffolds. Overall, these results demonstrated that the approach offer a promising avenue for accelerating the early drug discovery process.
研究动机与目标
- 通过整合来自分子动力学(MD)模拟的动态构象集合,解决静态晶体结构在结合亲和力预测中的局限性。
- 克服在数据驱动药物发现中,蛋白质-配体复合物大规模、公开可用的MD数据集缺乏的问题。
- 开发一种深度学习模型,从MD轨迹中学习几何特征与相互作用特征,以提升打分与排序的准确性。
- 实现在多样化蛋白靶点上具有高预测能力与良好泛化能力的高效虚拟筛选。
- 通过实验结合亲和力测量验证模型预测结果,识别出具有潜在前景新骨架结构的新型命中化合物。
提出的方法
- 从PDBBind数据库中整理出包含3,218个蛋白质-配体复合物的大规模MD数据集,对每个复合物进行MD模拟以捕获动态构象集合。
- 提出Dynaformer,一种图变换器模型,将蛋白质-配体复合物表示为动态图,从MD轨迹中随时间演变的结构特征中学习。
- 通过3D几何特征与化学指纹对结构进行编码,以丰富图网络中节点的表示。
- 采用多头注意力机制,建模模拟帧之间蛋白质-配体相互作用的长程关联与动态变化。
- 端到端训练模型以预测pKi值,损失函数最小化均方根误差(RMSE)并最大化与实验亲和力的皮尔逊相关系数。
- 通过消融研究分离MD数据、结构编码与指纹特征对模型性能的独立贡献。
实验结果
研究问题
- RQ1与静态晶体结构相比,将MD模拟中的动态结构信息纳入模型是否能显著提升蛋白质-配体结合亲和力预测的准确性?
- RQ2基于MD轨迹训练的图神经网络模型在基准数据集上的打分与排序能力,相较于现有最先进方法,提升程度如何?
- RQ3该模型能否在虚拟筛选中识别出具有新颖骨架结构的高亲和力配体,尤其是此前未报道过的结构?
- RQ4动态相互作用(如瞬时结合模式与构象稳定性)与实验测得的结合亲和力之间是否存在显著相关性?
- RQ5模型捕捉柔性配体区域熵与焓贡献的能力,是否能提升对如活性悬崖等复杂情况的预测准确性?
主要发现
- Dynaformer在CASF-2016基准测试中达到当前最优性能,皮尔逊相关系数(r)为0.82,均方根误差(RMSE)为1.05 pKi单位,优于以往方法。
- 模型展现出卓越的排序能力,在57个蛋白靶点上平均斯皮尔曼等级相关系数(ρ)为0.71,肯德尔等级相关系数(τ)为0.52,表明其具有强大的相对亲和力预测能力。
- 消融研究证实,引入MD数据可持续提升打分与排序性能,完整模型优于仅基于晶体结构训练的版本。
- 在HSP90虚拟筛选中,Dynaformer成功识别出12种具有可测量结合亲和力的命中化合物,其中5种具有亚微摩尔Ki值,且包含多个新颖骨架结构。
- 通过表面等离子体共振(SPR)实验验证,Dynaformer的预测结果与实测Ki值高度一致,证实了其预测准确性。
- 模型有效捕捉了如构象稳定性与相互作用持久性等动态特征,即使在骨架结构相似的配体之间,也能解释其结合亲和力的差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。