Skip to main content
QUICK REVIEW

[论文解读] Do Deep Learning Methods Really Perform Better in Molecular Conformation Generation?

Gengmo Zhou, Zhifeng Gao|arXiv (Cornell University)|Feb 14, 2023
Computational Drug Discovery Methods被引用 5
一句话总结

该论文提出了一种简单、无需超参数调节的算法,结合RDKit的ETKDG构象生成方法与多种采样策略(均匀、几何、能量),并辅以无监督聚类,生成高质量的分子构象。令人惊讶的是,该方法在GEOM-QM9和GEOM-Drugs等标准基准测试中表现优于当前最先进(SOTA)的深度学习模型,挑战了深度学习在分子构象生成中固有优越性的假设。

ABSTRACT

Molecular conformation generation (MCG) is a fundamental and important problem in drug discovery. Many traditional methods have been developed to solve the MCG problem, such as systematic searching, model-building, random searching, distance geometry, molecular dynamics, Monte Carlo methods, etc. However, they have some limitations depending on the molecular structures. Recently, there are plenty of deep learning based MCG methods, which claim they largely outperform the traditional methods. However, to our surprise, we design a simple and cheap algorithm (parameter-free) based on the traditional methods and find it is comparable to or even outperforms deep learning based MCG methods in the widely used GEOM-QM9 and GEOM-Drugs benchmarks. In particular, our design algorithm is simply the clustering of the RDKIT-generated conformations. We hope our findings can help the community to revise the deep learning methods for MCG. The code of the proposed algorithm could be found at https://gist.github.com/ZhouGengmo/5b565f51adafcd911c0bc115b2ef027c.

研究动机与目标

  • 评估基于深度学习的方法是否真正优于传统构象生成技术在分子构象生成中的表现。
  • 探究当前基准(如GEOM-QM9和GEOM-Drugs)的局限性与潜在偏差。
  • 提出一种仅基于经典化学信息学方法的简单、高效且有效的深度学习替代方案。
  • 倡导基于下游应用性能(而非独立的构象指标)来评估分子构象生成。
  • 挑战深度学习在构象生成中固有优越性的假设,尤其考虑到此类模型在真实世界中尚未得到广泛应用。

提出的方法

  • 利用RDKit的ETKDG算法进行初始构象生成,并采用多样化的采样策略:均匀采样、几何采样和基于能量的采样。
  • 应用三种不同的采样器,生成比标准ETKDG更广泛、更多样化的构象集合。
  • 采用无监督聚类算法(如k-means或类似方法)从大量构象中筛选出具有代表性的低能构象。
  • 使用标准指标——覆盖率(COV)和匹配度(MAT)——在GEOM-QM9和GEOM-Drugs基准上评估性能。
  • 通过改变采样构象数量以及移除单个采样器进行消融研究,评估其对多样性与准确性的贡献。
  • 将聚类增强后的RDKit流程最终性能与多种最先进深度学习模型(包括GraphDG、ConfVAE、ConfGF、GeoMol、DGSM、GeoDiff和DMCG)进行比较。

实验结果

研究问题

  • RQ1基于经典构象生成技术的简单、无需超参数调节的算法是否能在分子构象生成中超越最先进深度学习模型?
  • RQ2鉴于传统方法可轻松超越这些基准,当前基准(如GEOM-QM9和GEOM-Drugs)在多大程度上存在偏差或可被操纵?
  • RQ3不同的采样策略(均匀、几何、能量)如何影响生成构象的多样性与准确性?
  • RQ4当前的分子构象生成评估范式是否足以反映真实应用场景(如分子对接或量子性质预测)?
  • RQ5未来基准测试是否应聚焦于下游应用性能,而非独立的构象指标?

主要发现

  • 所提出的RDKit + 聚类方法在GEOM-QM9上实现了97.65%的COV和0.1902 Å的MAT,优于表1中列出的所有深度学习模型。
  • 在GEOM-Drugs基准上,该方法实现了87.93%的COV和0.8086 Å的MAT,超越了所有深度学习模型,包括GeoDiff和DMCG。
  • 消融研究显示,移除能量采样器会降低性能,而移除均匀采样器的影响较小,表明多样性与准确性之间存在权衡。
  • 几何采样器对多样性和准确性均有积极贡献,表明其在平衡覆盖率与匹配度方面具有重要意义。
  • 当采样构象数量达到参考构象数量的10倍($10N_{ref}$)时,该方法在GEOM-QM9上实现了96.49%的COV和0.1941 Å的MAT,表明增加采样可提升性能。
  • 研究结论认为,当前基准可能易受操纵且不足以代表真实世界需求,尤其在生物活性构象生成或量子性质预测等特定应用任务中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。