Skip to main content
QUICK REVIEW

[論文レビュー] Dual-view Molecule Pre-training

Jinhua Zhu, Yingce Xia|arXiv (Cornell University)|Jun 17, 2021
Computational Drug Discovery Methods参考文献 55被引用数 15
ひとこと要約

本稿では、SMILES配列(Transformerを介して)と分子グラフ(GNNを介して)の両方を統合的に活用して統一的な分子表現を学ぶ、新たな事前学習フレームワークであるDual-view Molecule Pre-training (DMP) を提案する。マスクされた言語モデリング、マスクされた原子予測、および2つの視点間の類似度を最大化する二重視点一貫性目的関数を組み合わせることで、DMPは9つの分子性質予測タスクのうち7つ、および3つのレトロ合成タスクにおいて最先端の性能を達成し、従来手法に比べ顕著な向上を示す。

ABSTRACT

Inspired by its success in natural language processing and computer vision, pre-training has attracted substantial attention in cheminformatics and bioinformatics, especially for molecule based tasks. A molecule can be represented by either a graph (where atoms are connected by bonds) or a SMILES sequence (where depth-first-search is applied to the molecular graph with specific rules). Existing works on molecule pre-training use either graph representations only or SMILES representations only. In this work, we propose to leverage both the representations and design a new pre-training algorithm, dual-view molecule pre-training (briefly, DMP), that can effectively combine the strengths of both types of molecule representations. The model of DMP consists of two branches: a Transformer branch that takes the SMILES sequence of a molecule as input, and a GNN branch that takes a molecular graph as input. The training of DMP contains three tasks: (1) predicting masked tokens in a SMILES sequence by the Transformer branch, (2) predicting masked atoms in a molecular graph by the GNN branch, and (3) maximizing the consistency between the two high-level representations output by the Transformer and GNN branches separately. After pre-training, we can use either the Transformer branch (this one is recommended according to empirical results), the GNN branch, or both for downstream tasks. DMP is tested on nine molecular property prediction tasks and achieves state-of-the-art performances on seven of them. Furthermore, we test DMP on three retrosynthesis tasks and achieve state-of-the-art results on them.

研究の動機と目的

  • 既存の分子事前学習手法が、SMILES配列または分子グラフのいずれかの表現タイプに依存しているという制限を解消すること。
  • Transformerベースの系列モデリングとGNNベースの構造モデリングの相補的な強みが、分子表現学習に与える影響を調査すること。
  • 両方の視点を同時に最適化し、その高次元表現の間の一貫性を強制する統一的な事前学習フレームワークを設計すること。
  • より良い、より頑健な表現をもたらすことで、分子性質予測およびレトロ合成タスクにおける下流性能を向上させること。

提案手法

  • DMPは二重ブランチアーキテクチャを採用しており、SMILES配列を処理するTransformerブランチと、分子グラフを処理するGNNブランチを持つ。
  • モデルは3つの目的関数を用いて事前学習される:SMILES配列におけるマスクトークン予測、分子グラフにおけるマスク原子予測、および対照的学習を用いた二重視点一貫性。
  • 二重視点一貫性目的関数は、2つのブランチからの投影表現間のコサイン類似度を最大化することで、BYOLフレームワークを模倣する。
  • 表現の一貫性は、Transformer出力およびGNN出力の両方に適用されるプロジェクションヘッドを通じて強制される。
  • 事前学習後、モデルは下流タスクのために、Transformerブランチのみ、GNNブランチのみ、または両方を用いて微調整可能であり、実験結果では下流タスクにおいてTransformerブランチが優位であることが示された。
  • 事前学習はPubChemの1,000万個の分子を対象とし、その後MoleculeNetおよびレトロ合成ベンチマークで微調整が行われた。

実験結果

リサーチクエスチョン

  • RQ1SMILES系列と分子グラフの両方の表現を組み合わせることで、単独で使用する場合よりも分子表現学習が向上するか?
  • RQ2二重視点表現間の一貫性を強制することで、分子性質予測およびレトロ合成タスクにおける下流性能が向上するか?
  • RQ3二重視点一貫性目的関数は、単独のマスク言語モデリングのような標準的な事前学習目的関数と比較して、どのように優れているか?
  • RQ4単一視点モデルと比較して、二重視点アプローチはスケルトンレベルの構造的情報をよりよく捉えられるか?
  • RQ5SMILESとグラフ視点の共同学習により、多様な分子構造にわたるより頑健で汎用性の高い表現が得られるか?

主な発見

  • DMPはMoleculeNetの9つの分子性質予測タスクのうち7つで最先端の性能を達成し、MolCLRとGROVERをそれぞれ平均1.2点および2.2点上回った。
  • USPTO-50kデータセットを用いたレトロ合成タスクでは、未知の反応タイプ設定でトップ1正答率を42.3%から46.1%に向上させ、反応タイプが与えられた場合も54.2%から57.5%に向上した。
  • USPTO-fullデータセットでは、DMPがTransformerベースラインのトップ1正答率を2.1ポイント向上させ、新たな最先端性能を樹立した。
  • t-SNEおよびDBインデックスを用いた可視化では、DMPの表現がスケルトンごとに分子をよりよく分離しており、DBインデックスは2.19(GNN:3.56、Transformer:3.59)を示した。
  • GNNベースのモデルにDMPを組み合わせることで、レトロ合成タスクで最先端の結果が得られ、GLNおよびDeeperGCNベースラインと比較して2.3~3.3ポイントの向上を達成した。
  • アブレーションスタディにより、性能向上はアーキテクチャの差異ではなく、事前学習によるものであると確認され、DMPとDeeperGCNを組み合わせることでさらなる性能向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。