[论文解读] Development and evaluation of a deep learning model for protein-ligand binding affinity prediction
该论文提出Pafnucy,一种3D卷积神经网络,通过处理复合物的3D网格表示来预测蛋白质-配体结合亲和力,将蛋白质和配体原子统一处理。它在CASF基准测试中优于20种最先进的打分函数,并在输入扰动下表现出鲁棒性,通过显著性分析揭示了关键相互作用位点。
Structure based ligand discovery is one of the most successful approaches for augmenting the drug discovery process. Currently, there is a notable shift towards machine learning (ML) methodologies to aid such procedures. Deep learning has recently gained considerable attention as it allows the model to "learn" to extract features that are relevant for the task at hand. We have developed a novel deep neural network estimating the binding affinity of ligand-receptor complexes. The complex is represented with a 3D grid, and the model utilizes a 3D convolution to produce a feature map of this representation, treating the atoms of both proteins and ligands in the same manner. Our network was tested on the CASF "scoring power" benchmark and Astex Diverse Set and outperformed classical scoring functions. The model, together with usage instructions and examples, is available as a git repository at http://gitlab.com/cheminfIBB/pafnucy
研究动机与目标
- 开发一种无需依赖手工设计分子描述符的深度学习模型,以预测蛋白质-配体结合亲和力。
- 通过使模型能够直接从3D结构数据中学习相关特征,减少对专家驱动特征工程的依赖。
- 通过捕捉蛋白质-配体复合物中复杂且非线性的相互作用,提高虚拟筛选的准确性。
- 通过分析模型在输入扰动和取向变化下的行为,确保其鲁棒性和可解释性。
- 为研究社区提供一个免费、可扩展的工具,包含完整的训练、预测和数据准备工作流。
提出的方法
- 该模型使用3D卷积神经网络处理蛋白质-配体复合物的3D网格表示,将原子属性编码在体素化空间中。
- 蛋白质和配体的原子在输入网格中被同等对待,从而实现在整个复合物上统一的特征学习。
- 网络采用多层3D卷积,随后是非线性激活和池化操作,以提取分层的空间特征。
- 模型训练使用回归损失,以最小化预测值与基准数据集中实验测得的结合亲和力之间的差异。
- 输入数据通过基于网格的表示进行预处理,分辨率为1.0 Å,并在复合物周围添加5 Å的填充区域。
- 通过显著性分析评估可解释性:通过从网格中移除5 Å的立方区域生成受损输入,并测量其对预测结果的影响。
实验结果
研究问题
- RQ1深度3D卷积网络能否在无需专家设计描述符的情况下,直接从3D结构数据中学习到相关的结合特征?
- RQ2该模型在标准化基准测试中与已建立的打分函数相比表现如何?
- RQ3蛋白质-配体复合物的哪些区域对预测的结合亲和力影响最大?
- RQ4该模型在相同复合物的不同取向下是否能产生一致的预测?
- RQ5该模型的内部表征能否揭示具有生物意义的相互作用?
主要发现
- Pafnucy在CASF的'打分能力'基准测试中优于所有20种测试的最先进的打分函数,表现出卓越的预测准确性。
- 该模型对同一复合物的原始取向和180°旋转取向均实现了稳定的预测,表明其对输入变换具有鲁棒性。
- 显著性分析显示,当移除配体及其邻近蛋白质残基(Gln726、Phe729)时,预测亲和力下降最显著,证实了已知的相互作用位点。
- 在考虑前15个最具破坏性的删除操作时,额外识别出Tyr693和Met713为关键影响残基,与已知的氢键和疏水相互作用一致。
- 早期卷积层的激活在不同取向下差异显著,但在深层网络中逐渐趋于相似,表明网络学习到了不变的表征。
- 该模型的性能和可解释性在Astex多样集上得到验证,进一步证实其在CASF基准之外的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。