Skip to main content
QUICK REVIEW

[论文解读] Evaluating Self-Supervised Learning for Molecular Graph Embeddings

Hanchen Wang, Jean Kaddour|arXiv (Cornell University)|Jun 16, 2022
Computational Drug Discovery Methods被引用 7
一句话总结

本文提出 MolGraphEval,一个全面的基准测试,用于通过跨图拓扑、分子亚结构和嵌入空间属性的多样化探针任务,评估自监督分子图嵌入。该研究揭示了标准下游评估与深层探针之间的一致性差异,表明对比学习方法在属性预测任务中表现优异,但未必在亚结构或拓扑任务中表现突出;同时,特征均匀性并不总能预测性能表现。

ABSTRACT

Graph Self-Supervised Learning (GSSL) provides a robust pathway for acquiring embeddings without expert labelling, a capability that carries profound implications for molecular graphs due to the staggering number of potential molecules and the high cost of obtaining labels. However, GSSL methods are designed not for optimisation within a specific domain but rather for transferability across a variety of downstream tasks. This broad applicability complicates their evaluation. Addressing this challenge, we present "Molecular Graph Representation Evaluation" (MOLGRAPHEVAL), generating detailed profiles of molecular graph embeddings with interpretable and diversified attributes. MOLGRAPHEVAL offers a suite of probing tasks grouped into three categories: (i) generic graph, (ii) molecular substructure, and (iii) embedding space properties. By leveraging MOLGRAPHEVAL to benchmark existing GSSL methods against both current downstream datasets and our suite of tasks, we uncover significant inconsistencies between inferences drawn solely from existing datasets and those derived from more nuanced probing. These findings suggest that current evaluation methodologies fail to capture the entirety of the landscape.

研究动机与目标

  • 为自监督分子图学习(GSSL)方法解决缺乏标准化、可解释性评估的问题。
  • 识别当前评估实践的局限性,这些实践仅依赖于下游分子属性预测(MPP)任务。
  • 开发一个全面的探针框架,以捕捉学习到的嵌入在MPP性能之外的多样化属性。
  • 通过统一基准测试,对1,875个预训练GNN和90,918个探针模型进行无偏见的多维度评估,实现对GSSL方法的全面评估。
  • 揭示基于标准MPP评估与深层探针之间的差异,表明GSSL方法并非在所有情况下都更优,且在某些结构属性上可能表现不佳。

提出的方法

  • 提出 MolGraphEval,一个基准测试框架,通过三类探针任务评估预训练的分子图嵌入:通用图属性、分子亚结构识别和嵌入空间特征。
  • 在1,875个预训练GNN的固定嵌入上训练探针模型,使用9种GSSL方法(如GraphCL、InfoGraph、GraphMAE)在200万条ZINC15数据上进行训练。
  • 设计用于评估度分布、聚类系数、直径和度相关性等拓扑特征的探针任务,通过MSE或交叉熵评估性能。
  • 在下游MPP数据集(如BBBP、Tox21等)上使用线性探针模型评估迁移性能,并与微调结果进行比较。
  • 应用统计分析(相关性、p值)评估探针性能与下游MPP得分之间的关系。
  • 将基准测试扩展至包含GraphMAE和GRCL等新方法,并在更大数据集(如200万条ZINC15)上进行验证。

实验结果

研究问题

  • RQ1当不仅在下游分子属性预测任务,而且在针对图拓扑和亚结构特征的探针任务中评估时,GSSL方法的表现如何?
  • RQ2与更细致的探针相比,标准MPP基准在多大程度上误导了对GSSL方法的评估?
  • RQ3特征分布均匀性——常被认为表示良好表征——是否与下游MPP性能相关?
  • RQ4对比学习GSSL方法是否在所有类型的探针任务中普遍优于生成式或掩码自编码方法?
  • RQ5即使预训练目标不理想,预训练超参数调优是否能显著提升性能?

主要发现

  • 对比学习GSSL方法(如GraphCL)在下游MPP任务中表现最佳(例如,在BBBP数据集上平均AUC达65.07),但这并不总意味着其在亚结构或拓扑属性检测等探针任务中表现更优。
  • 随机初始化的GNN在图直径和连通性等拓扑属性上优于部分GSSL方法,表明GSSL并非对所有结构属性都具有普遍优势。
  • InfoGraph通过最大化互信息并生成最均匀的特征分布,在9种GSSL方法中MPP任务仅排名第7,挑战了‘均匀性即更优’的假设。
  • 与线性探针相比,微调预训练模型能持续提升下游MPP性能,且微调与线性探针设置下的最优预训练配置存在差异。
  • MPP性能与探针任务性能之间的相关性较弱(例如,度分布的r=0.842,p=0.002),表明仅依赖MPP得分不足以进行全面评估。
  • 预训练超参数优化能显著提升性能,表明模型设计与训练设置与预训练目标的选择同等重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。