Skip to main content
QUICK REVIEW

[论文解读] Leveraging binding-site structure for drug discovery with point-cloud methods

Vincent Mallet, Carlos Oliver|arXiv (Cornell University)|May 28, 2019
Computational Drug Discovery Methods被引用 5
一句话总结

该论文提出TarLig,一种基于点云的深度学习模型,利用蛋白质结合口袋的三维结构来预测潜在化学空间中的配体偏好。通过应用数据对齐与增强技术,TarLig在性能上优于标准3D卷积神经网络(3D-CNN),在潜在空间维度上实现平均方差降低2倍,从而更有效地指导配体生成与虚拟筛选。

ABSTRACT

Computational drug discovery strategies can be broadly placed in two categories: ligand-based methods which identify novel molecules by similarity with known ligands, and structure-based methods which predict molecules with high-affinity to a given 3D structure (e.g. a protein). However, ligand-based methods do not leverage information about the binding site, and structure-based approaches rely on the knowledge of a finite set of ligands binding the target. In this work, we introduce TarLig, a novel approach that aims to bridge the gap between ligand and structure-based approaches. We use the 3D structure of the binding site as input to a model which predicts the ligand preferences of the binding site. The resulting predictions could then offer promising seeds and constraints in the chemical space search, based on the binding site structure. TarLig outperforms standard models by introducing a data-alignment and augmentation technique. The recent popularity of Volumetric 3DCNN pipelines in structural bioinformatics suggests that this extra step could help a wide range of methods to improve their results with minimal modifications.

研究动机与目标

  • 通过将结合口袋几何结构融入配体空间预测,弥合基于配体与基于结构的药物发现之间的差距。
  • 解决基于配体的方法忽略结合口袋信息,以及基于结构的方法依赖已知配体的局限性。
  • 开发一种仅利用结合口袋3D结构来引导搜索新颖高亲和力配体的模型。
  • 通过识别潜在配体空间中富含活性配体的子区域,提升化学空间探索的效率与覆盖度。
  • 提出一种简单但有效的数据对齐与增强策略,以提升3D-CNN在结合口袋点云上的性能。

提出的方法

  • 将3D结合口袋表示为点云,并使用通过数据对齐与增强实现旋转不变学习的3D卷积神经网络(3D-CNN)。
  • 在输入模型前对结合口袋点云进行旋转与平移对齐,以标准化数据,提升特征学习效果。
  • 训练一个包含7个卷积层和2个全连接层的深度学习模型,基于结合口袋结构预测配体的潜在嵌入表示。
  • 采用自监督对比学习目标,从未知配体共结晶复合物中学习有意义的结合口袋表征。
  • 利用学习到的潜在空间识别富含活性配体的区域,实现针对性的虚拟筛选。
  • 使用DUDE数据库评估模型,通过测量活性化合物与去活化合物相对于预测结果的富集因子和基于距离的排序表现进行评价。

实验结果

研究问题

  • RQ1基于3D结合口袋点云训练的深度学习模型,能否预测配体空间中富含活性化合物的有意义子区域?
  • RQ2与标准体素化CNN相比,数据对齐与增强是否能提升3D-CNN在结合口袋表征学习中的泛化能力与性能?
  • RQ3在缺乏已知活性配体先验知识的情况下,结合口袋结构在多大程度上可独立引导新颖配体的搜索?
  • RQ4潜在空间中的方差减少与随机采样相比如何?这对化学空间覆盖意味着什么?
  • RQ5模型的预测结果能否通过将化合物按与已知活性配体的距离排序,实现虚拟筛选的富集?

主要发现

  • 与随机采样相比,TarLig在潜在空间每个维度上实现了2倍的平均方差降低,显著提升了高亲和力配体区域的覆盖度。
  • 模型预测结果与已知活性配体之间的均方误差(MSE)为0.13,低于随机基线的0.2,表明其对活性区域的定位具有较高准确性。
  • 模型在DUDE数据库的大多数靶点上均实现了可测量的富集因子,表明预测区域比去活化合物更接近活性化合物。
  • 数据对齐与增强步骤在性能上优于标准3D-CNN和3D可微分CNN,表明其在3D形状表征中的有效性。
  • 该方法仅需一次从结合口袋结构出发的预测,提供了一种可扩展的替代方案,避免了计算成本高昂的对接或迭代筛选。
  • 潜在空间嵌入具有足够的结构化特征,可支持下游任务如配体生成与优化,且具备在大规模结构数据上进行自监督预训练的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。