[论文解读] Topological fingerprints reveal protein-ligand binding mechanism
本文提出元素特异性持久同调(ESPH)和拓扑指纹(TFs),以捕捉蛋白质-配体复合物的关键几何与化学特征,并将其与机器学习结合,实现精确的结合亲和力预测。所提出的基于拓扑的打分函数(T-Score)在基准数据集上达到0.817的中位皮尔逊相关系数和1.912 kcal/mol的均方根误差,通过有效平衡拓扑抽象与生物特异性,优于现有方法。
Protein-ligand binding is a fundamental biological process that is paramount to many other biological processes, such as signal transduction, metabolic pathways, enzyme construction, cell secretion, gene expression, etc. Accurate prediction of protein-ligand binding affinities is vital to rational drug design and the understanding of protein-ligand binding and binding induced function. Existing binding affinity prediction methods are inundated with geometric detail and involve excessively high dimensions, which undermines their predictive power for massive binding data. Topology provides an ultimate level of abstraction and thus incurs too much reduction in geometric information. Persistent homology embeds geometric information into topological invariants and bridges the gap between complex geometry and abstract topology. However, it over simplifies biological information. This work introduces element specific persistent homology (ESPH) to retain crucial biological information during topological simplification. The combination of ESPH and machine learning gives rise to one of the most efficient and powerful tools for revealing protein-ligand binding mechanism and for predicting binding affinities.
研究动机与目标
- 为解决现有打分函数在预测蛋白质-配体结合亲和力时,因过度依赖几何细节或损失生物特异性而带来的局限性。
- 通过将多尺度几何信息嵌入拓扑不变量,弥合高维几何模型与抽象拓扑抽象之间的鸿沟。
- 开发一种低维、具有生物意义的蛋白质-配体相互作用表示方法,同时保留关键的化学与结构信息以实现精确预测。
- 通过相互作用网络与空间尺度的拓扑分析,揭示蛋白质-配体结合的分子机制。
- 证明基于持久同调的拓扑指纹在大规模基准数据集上显著提升结合亲和力预测性能。
提出的方法
- 采用元素特异性持久同调(ESPH)分别计算不同化学元素的拓扑不变量(贝蒂数),在拓扑抽象过程中保留元素特异的生物信息。
- 应用基于相关函数的过滤方法,包括洛伦兹函数与指数函数,以建模多尺度相互作用,参数(ν, τ)用于调节有效相互作用长度尺度。
- 引入分箱条形码表示(BBR),通过在尺度区间内对贝蒂数进行分箱,将持久同调条形码转换为紧凑、适用于机器学习的特征。
- 采用交互式持久同调(IPH)描述蛋白质-配体相互作用,尤其聚焦于C–C网络及其拓扑持久性。
- T-Score模型结合所有重原子的Betti-0、Betti-1与Betti-2特征、碳特异性ESTFs,以及基于多尺度相关性的过滤方法,生成低维、可预测的特征集合。
- 对PDBBind v2007核心集执行500次随机交叉验证,以评估T-Score模型的鲁棒性与泛化能力。
实验结果
研究问题
- RQ1如何调整从持久同调导出的拓扑不变量,以在蛋白质-配体复合物中保留与生物相关的化学信息?
- RQ2在准确预测结合亲和力方面,拓扑抽象与几何特异性之间应如何实现最优平衡?
- RQ3哪些相互作用尺度和残基层(如第一或第二壳层)对预测蛋白质-配体结合亲和力最具预测力?
- RQ4长程C–C相互作用(超过40 Å)在多大程度上对结合亲和力预测有贡献?
- RQ5在大规模结合亲和力预测中,拓扑指纹是否能超越现有的物理基、知识基与经验打分函数?
主要发现
- T-Score模型在PDBBind v2007核心集上达到0.817的中位皮尔逊相关系数与1.912 kcal/mol的均方根误差,显著优于现有方法。
- 基于洛伦兹相关函数的Betti-0 ESTFs在(ν, τ)=(3, 2)时获得0.769的皮尔逊相关系数,而指数函数在κ = τ = 1时达到0.782。
- 将三组Betti-0 ESTFs在(ν, τ)=(3, 0.5)、(3, 1)与(3, 2)下组合后,相关系数提升至0.784,表明多尺度分析具有显著优势。
- 在τ ≈ 1.6与3.1处预测准确率出现振荡峰,表明残基第一与第二配位层在结合亲和力中起关键作用。
- 蛋白质-配体C–C相互作用在前两层中显著贡献于预测,但其影响在3–5 τ之间逐渐减弱。
- 在大尺度长度(τ > 5)下,蛋白质-配体C–C的Betti-1与Betti-2特征表现出出人意料的预测能力回升,表明长程疏水效应可延伸至结合位点40 Å以外。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。