[论文解读] Knowledge-aware Contrastive Molecular Graph Learning
该论文提出对比知识感知图神经网络(CKGNN),一种自监督分子表征学习框架,通过对比学习显式地将化学领域知识(如指纹和官能团)整合到图神经网络中。该方法在八个数据集上的分子性质预测任务中,相较于强基线模型实现了6%的绝对平均性能提升,显著增强了对结构相似但功能不同的分子的判别能力。
Leveraging domain knowledge including fingerprints and functional groups in molecular representation learning is crucial for chemical property prediction and drug discovery. When modeling the relation between graph structure and molecular properties implicitly, existing works can hardly capture structural or property changes and complex structure, with much smaller atom vocabulary and highly frequent atoms. In this paper, we propose the Contrastive Knowledge-aware GNN (CKGNN) for self-supervised molecular representation learning to fuse domain knowledge into molecular graph representation. We explicitly encode domain knowledge via knowledge-aware molecular encoder under the contrastive learning framework, ensuring that the generated molecular embeddings equipped with chemical domain knowledge to distinguish molecules with similar chemical formula but dissimilar functions. Extensive experiments on 8 public datasets demonstrate the effectiveness of our model with a 6\% absolute improvement on average against strong competitors. Ablation study and further investigation also verify the best of both worlds: incorporation of chemical domain knowledge into self-supervised learning.
研究动机与目标
- 为解决图神经网络在捕捉细微化学变化(如官能团替换)方面的局限性,这些变化会显著改变分子性质。
- 通过显式整合领域知识(如指纹和官能团)到图神经网络中,提升分子表征学习能力。
- 解决分子嵌入中因原子种类少和高频原子(如碳)导致的歧义性问题。
- 实现自监督预训练,利用化学知识提升下游任务的泛化能力。
- 证明将领域知识与对比学习结合,相比仅依赖数据或结构的模型,能取得更优性能。
提出的方法
- 提出一种知识感知的分子编码器,显式将子图级别的领域知识(如官能团和指纹)编码到节点和图嵌入中。
- 采用基于指纹相似度比较分子对的对比学习框架,学习在结构扰动下保持不变的表征。
- 利用分子聚类策略将指纹相似的分子分组,形成对比训练的正样本对。
- 设计一种对比损失函数,通过化学领域知识引导,最大化相似分子嵌入的一致性,同时拉大不相似分子之间的距离。
- 结合图神经网络的消息传递机制与知识感知特征,以在潜在空间中同时保留结构和化学信息。
- 在超过240万个分子上进行自监督训练,实现对下游性质预测任务的迁移。
实验结果
研究问题
- RQ1将化学领域知识显式整合到图神经网络中,是否能超越仅依赖结构信息的分子表征学习?
- RQ2基于指纹的正样本对进行对比学习,如何提升模型区分分子式相同但功能不同的分子的能力?
- RQ3知识感知特征注入在多大程度上减少了对高频原子(如碳)的嵌入歧义性?
- RQ4领域知识与对比预训练的融合是否优于仅依赖大规模数据或结构学习的模型?
- RQ5通过改进的嵌入去歧义化,模型能否有效区分结构异构体(分子式相同但官能团不同)?
主要发现
- 与强基线相比,CKGNN在八个基准数据集上的分子性质预测任务中实现了6%的绝对平均性能提升。
- 消融实验表明,移除知识感知特征或分子聚类策略会导致性能显著下降,证实了二者关键作用。
- CKGNN嵌入的相似性分布方差最大(0.067),表明其表征更丰富、更具多样性,优于GCC和预训练GIN模型。
- 在案例研究中,仅CKGNN能成功识别具有相同子结构(如羧基和苯环)的分子,而仅依赖结构的GNN则失败。
- 对于结构异构体,CKGNN产生的相似度分数显著更低(如0.2661和0.1180),而GCC和预训练GIN的相似度接近1.0,证明其具备更优的去歧义能力。
- 该模型在性能上优于仅依赖领域知识或大规模数据的模型,证明知识与自监督学习融合是最佳策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。