[论文解读] Mathematical deep learning for pose and binding affinity prediction and ranking in D3R Grand Challenges
该论文提出了一套数学深度学习框架,结合多尺度加权彩色图与元素特异性持久同调,与机器学习模型集成,用于预测和排名D3R Grand Challenges中的蛋白质-配体结合亲和力。该方法在D3R GC3的26项官方任务中取得10项第一,并在GC2中绝对自由能预测排名领先,展现出在药物发现应用中的强大预测能力。
Advanced mathematics, such as multiscale weighted colored graph and element specific persistent homology, and machine learning including deep neural networks were integrated to construct mathematical deep learning models for pose and binding affinity prediction and ranking in the last two D3R grand challenges in computer-aided drug design and discovery. D3R Grand Challenge 2 (GC2) focused on the pose prediction and binding affinity ranking and free energy prediction for Farnesoid X receptor ligands. Our models obtained the top place in absolute free energy prediction for free energy Set 1 in Stage 2. The latest competition, D3R Grand Challenge 3 (GC3), is considered as the most difficult challenge so far. It has 5 subchallenges involving Cathepsin S and five other kinase targets, namely VEGFR2, JAK2, p38-$α$, TIE2, and ABL1. There is a total of 26 official competitive tasks for GC3. Our predictions were ranked 1st in 10 out of 26 official competitive tasks.
研究动机与目标
- 开发一种数学深度学习框架,以提升计算机辅助药物设计中结合亲和力预测的准确性。
- 通过整合先进的拓扑与图论描述符,解决虚拟筛选中打分函数的局限性。
- 在缺乏高质量晶体结构的情况下,通过利用低维拓扑与几何表示,提升预测性能。
- 在大规模药物发现挑战中,系统评估模型在多样化蛋白质靶点与配体集合上的表现。
- 识别当前打分协议中的主要瓶颈,并通过解耦构象预测误差与打分性能,提升亲和力预测准确性。
提出的方法
- 采用多尺度加权彩色图(MWCG)在多个尺度上表示蛋白质-配体复合物,捕捉原子级相互作用与柔性特征。
- 应用元素特异性持久同调(PH)提取编码生物分子结构几何与连通性特征的拓扑不变量。
- 基于原子半径设计过滤参数,生成一组拓扑结构,实现对生物分子形状与空腔形成的系统性分析。
- 将这些数学描述符整合进机器学习模型,包括随机森林与深度卷积神经网络,用于回归与排序任务。
- 探索多种打靶协议(如交叉打靶、自由-IFD、约束-IFD),生成多样化的配体构象,作为打分模型的输入。
- 将拓扑与基于图的特征与物理及经验描述符结合,提升在多样化蛋白质-配体复合物中的泛化能力与预测准确性。
实验结果
研究问题
- RQ1多尺度加权彩色图与元素特异性持久同调能否作为蛋白质-配体结合亲和力预测的有效、低维描述符?
- RQ2与传统打分函数相比,代数拓扑与深度学习的结合在提升结合亲和力排序与自由能预测准确性方面有何优势?
- RQ3构象预测误差在多大程度上限制了基于机器学习的打分函数在虚拟筛选中的性能?
- RQ4数学深度学习模型能否在D3R GC3等大规模药物发现挑战中,于多样化且具有挑战性的靶标上实现最先进性能?
- RQ5当缺乏晶体结构时,哪种打靶协议能提供最可靠的构象以供后续亲和力预测?
主要发现
- 在D3R Grand Challenge 3中,该模型在26项官方竞赛任务中取得10项第一,包括在组织蛋白酶S与ABL1子挑战中排名领先。
- 在组织蛋白酶S子挑战中,该模型(收据ID uuihe)在排除Kd > 10 μM的样本后,亲和力排序的Kendall’s τ = 0.57,Spearman等级相关系数 = 0.76,活性/非活性分类的MCC = 0.78。
- 在GC3的Set 1绝对自由能预测中,该模型(收据ID vwbp8)达到MCC = 1.0,即最高可能得分,表明预测性能完美。
- 在GC3的Set 2中,该模型(收据ID 5g8ed)实现了最低的RMSE为1.02 kcal/mol(MSE = 1.04),优于所有其他提交结果。
- 在D3R GC2中,该模型在Stage 2的Set 1自由能预测中排名第一,Kendall’s τ = 0.41,为两个阶段中所有提交结果的最高值。
- 当排除构象预测误差后,该模型在组织蛋白酶S子挑战中的Kendall’s τ从0.21提升至0.54,表明构象准确性是当前亲和力预测的主要瓶颈。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。