Skip to main content
QUICK REVIEW

[论文解读] Semi-supervised learning of hierarchical representations of molecules using neural message passing

Hai Nguyen, Shin‐ichi Maeda|arXiv (Cornell University)|Nov 28, 2017
Computational Drug Discovery Methods参考文献 16被引用 10
一句话总结

本文提出了一种基于神经消息传递的半监督分子层次表征学习方法,将段落向量(Paragraph Vector)扩展至图结构数据。该方法在无监督图表征学习中达到最先进性能,并表明在标注数据有限的情况下,半监督训练可显著提升预测准确率。

ABSTRACT

With the rapid increase of compound databases available in medicinal and material science, there is a growing need for learning representations of molecules in a semi-supervised manner. In this paper, we propose an unsupervised hierarchical feature extraction algorithm for molecules (or more generally, graph-structured objects with fixed number of types of nodes and edges), which is applicable to both unsupervised and semi-supervised tasks. Our method extends recently proposed Paragraph Vector algorithm and incorporates neural message passing to obtain hierarchical representations of subgraphs. We applied our method to an unsupervised task and demonstrated that it outperforms existing proposed methods in several benchmark datasets. We also experimentally showed that semi-supervised tasks enhanced predictive performance compared with supervised ones with labeled molecules only.

研究动机与目标

  • 解决药物和材料发现中分子标注数据有限的挑战。
  • 为作为图结构对象的分子开发一种无监督层次特征提取方法。
  • 通过神经消息传递将段落向量扩展至图结构,实现对分子子结构的层次表征。
  • 证明利用未标注数据的半监督学习可显著提升预测性能,优于仅使用少量标注分子的监督学习。
  • 在药物与材料科学中常见的低数据场景下,实现有效的分子表征学习。

提出的方法

  • 通过将每个分子视为‘文档’,其子结构视为‘词’,将段落向量方法适配至分子。
  • 利用神经消息传递,通过迭代聚合邻域特征,学习分子子图的层次表征。
  • 将消息传递与类似跳字模型(skip-gram)的目标函数结合,联合训练节点级与图级嵌入。
  • 采用负采样与噪声对比估计,使训练过程更具可扩展性与效率。
  • 使用可学习的读出层,从层次化的节点表征生成固定大小的图级嵌入。
  • 通过在标注与未标注分子上联合优化,将无监督模型扩展至半监督学习。

实验结果

研究问题

  • RQ1神经消息传递能否与段落向量有效结合,以学习分子的层次表征?
  • RQ2所提出的无监督方法是否在标准分子基准数据集上优于现有图表征学习基线方法?
  • RQ3在仅使用少量标注分子的情况下,利用大量未标注分子进行半监督学习,是否能提升预测性能?
  • RQ4在低数据场景下,随着标注数据量的增加,该方法的性能如何变化?
  • RQ5所学习的层次表征是否比现有指纹或核方法更有利于分子性质预测?

主要发现

  • 在 MUTAG 数据集上,该方法在无监督表征学习中达到 86.46% ± 5.97 的准确率,优于所有基线方法,包括 graph2vec(83.15% ± 9.25)。
  • 在 PTC 数据集上,该方法达到 62.86% ± 5.71 的准确率,优于所有对比方法,如 node2vec(58.85% ± 8.00)和 WL 核(59.61% ± 2.79)。
  • 在溶解度预测任务中,半监督方法(SemiNFP)将平均绝对误差从 1.85 ± 0.03(NFP 在 3% 标注数据下)降低至 1.56 ± 0.07(在 6% 标注数据下),表现出持续改进。
  • 在药物疗效预测(EC50)任务中,SemiNFP 在 18% 标注数据下达到 1.35 ± 0.19 MAE,优于 NFP 在相同条件下的 1.51 ± 0.21 MAE。
  • 结果表明,通过半监督学习引入未标注数据可显著提升模型性能,即使标注数据极少。
  • 据作者所知,这是首次成功将基于消息传递的图表征应用于分子性质预测的半监督框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。