Skip to main content
QUICK REVIEW

[論文レビュー] MoCL: Data-driven Molecular Fingerprint via Knowledge-aware Contrastive Learning from Molecular Graph

Mengying Sun, Jing Xing|arXiv (Cornell University)|Jun 5, 2021
Computational Drug Discovery Methods被引用数 9
ひとこと要約

MoCLは、局所的ドメイン知識(バイオイソストリックなサブ構造置換)とグローバルな知識(グラフ類似度)を統合することで、データ駆動型分子フィンガープrint学習を向上させる、知識に配慮した対照的学習フレームワークを提案する。局所的およびグローバルな対照的目的を同時に最適化することで、線形および半教師あり設定の下で、複数の分子特性予測ベンチマークで最先端の性能を達成した。

ABSTRACT

Recent years have seen a rapid growth of utilizing graph neural networks (GNNs) in the biomedical domain for tackling drug-related problems. However, like any other deep architectures, GNNs are data hungry. While requiring labels in real world is often expensive, pretraining GNNs in an unsupervised manner has been actively explored. Among them, graph contrastive learning, by maximizing the mutual information between paired graph augmentations, has been shown to be effective on various downstream tasks. However, the current graph contrastive learning framework has two limitations. First, the augmentations are designed for general graphs and thus may not be suitable or powerful enough for certain domains. Second, the contrastive scheme only learns representations that are invariant to local perturbations and thus does not consider the global structure of the dataset, which may also be useful for downstream tasks. Therefore, in this paper, we study graph contrastive learning in the context of biomedical domain, where molecular graphs are present. We propose a novel framework called MoCL, which utilizes domain knowledge at both local- and global-level to assist representation learning. The local-level domain knowledge guides the augmentation process such that variation is introduced without changing graph semantics. The global-level knowledge encodes the similarity information between graphs in the entire dataset and helps to learn representations with richer semantics. The entire model is learned through a double contrast objective. We evaluate MoCL on various molecular datasets under both linear and semi-supervised settings and results show that MoCL achieves state-of-the-art performance.

研究の動機と目的

  • 一般のグラフ拡張の限界に起因する、分子表現学習における意味的意味の破壊を是正すること。
  • 局所的不変性を超えて、分子グラフ間のグローバル構造的類似度を組み込むことで、対照的学習を改善すること。
  • 局所的およびグローバルドメイン知識を統合した包括的なフレームワークを構築し、分子データにおけるグラフニューラルネットワークのより良い事前学習を実現すること。
  • 提示手法の有効性を、線形および半教師あり学習プロトコルの下で、多様な分子特性予測タスクにおいて評価すること。

提案手法

  • 既存のサブ構造をバイオイソストリックに置き換えることで、分子の意味的意味を保持しつつ変異を導入する、新しいデータ拡張戦略「サブ構造置換」を提案する。
  • グローバル類似度メトリクスから導出される最近傍グラフを用いて、分子グラフ間のペアワイズ類似度を符号化するグローバル対照的損失を導入する。
  • 局所的拡張(MoCL-DK)とグローバル類似度の両方の対照的目的を組み合わせ、表現品質の向上を図る二重対照的目的を採用する。
  • 埋め込みを生成するためのグラフニューラルネットワークエンコーダとプロジェクションヘッドを用い、局所的およびグローバルなビューに対してInfoNCE損失を用いた対照的学習を実施する。
  • 局所的およびグローバル対照的損失の重み付き組み合わせを採用し、近隣サイズおよび損失重みのハイパーパrameterを用いて両目的のバランスを調整する。
  • 表現品質の検証として、線形評価(線形分類器によるプローブ)と半教師あり微調整を併用する。

実験結果

リサーチクエスチョン

  • RQ1バイオイソストリック置換に基づくドメイン特化拡張戦略は、一般のグラフ拡張と比較して、分子表現学習を向上させることができるか?
  • RQ2対照的学習にグローバルなグラフ類似度情報を組み込むことで、分子特性予測タスクの下流性能が向上するか?
  • RQ3対照的損失と最小二乗監視の両方のグローバル損失定式化が、表現品質に与える影響は何か?
  • RQ4グローバル対照的目的における近隣サイズや損失重みといったハイパーパrameterの感度はどの程度か?

主な発見

  • MoCL-DK1およびMoCL-DK3の拡張により、グローバル知識からの性能向上が最も顕著で、データセット全体で中央値AUC向上幅が0.015〜0.025に達した。
  • グローバル類似度の対照的損失(CL)は、直接の最小二乗監視(LS)を上回り、線形プロトコル下でデータセット全体で平均AUC向上幅が0.02〜0.04に達した。
  • MoCL-DK1-G(グローバル対照的損失を搭載)は、線形評価プロトコルにおいて7つの分子データセットのうち6つで、すべてのベースラインを上回る最先端の性能を達成した。
  • 学習済み表現に対して線形分類器を適用した場合、well-trainedなディープラーニングモデルのテストAUCを上回る結果が得られ、優れた事前学習品質を示した。
  • 感度分析の結果、中程度の近隣サイズ(例:10〜20)と中程度〜高い損失重み(λ ≈ 0.5〜1.0)で最適な性能が得られた。
  • 半教師あり微調整においても、MoCL-DK1-Gは7つのデータセットのうち5つで最高の結果を達成し、訓練パラダイムを問わず高いロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。