Skip to main content
QUICK REVIEW

[論文レビュー] A Systematic Survey of Chemical Pre-trained Models

Jun Xia, Yanqiao Zhu|arXiv (Cornell University)|Oct 29, 2022
Computational Drug Discovery Methods被引用数 8
ひとこと要約

本論文は、化学的事前学習モデル(CPMs)の包括的かつ体系的なサーベイを初めて提示し、分子記述子、エンコーダー・アーキテクチャ(例:GNN、Transformers)、事前学習戦略、および下流応用を体系的にレビューする。モデルの汎化性、ベンチマークの信頼性、理論的基盤における主な課題を特定し、創薬研究やそれ以上の分野における分子表現学習の発展に向けた批判的ロードマップを提示する。

ABSTRACT

Deep learning has achieved remarkable success in learning representations for molecules, which is crucial for various biochemical applications, ranging from property prediction to drug design. However, training Deep Neural Networks (DNNs) from scratch often requires abundant labeled molecules, which are expensive to acquire in the real world. To alleviate this issue, tremendous efforts have been devoted to Molecular Pre-trained Models (CPMs), where DNNs are pre-trained using large-scale unlabeled molecular databases and then fine-tuned over specific downstream tasks. Despite the prosperity, there lacks a systematic review of this fast-growing field. In this paper, we present the first survey that summarizes the current progress of CPMs. We first highlight the limitations of training molecular representation models from scratch to motivate CPM studies. Next, we systematically review recent advances on this topic from several key perspectives, including molecular descriptors, encoder architectures, pre-training strategies, and applications. We also highlight the challenges and promising avenues for future research, providing a useful resource for both machine learning and scientific communities.

研究の動機と目的

  • 深層学習におけるラベル付き分子データの不足を解消するため、解決策として化学的事前学習モデル(CPMs)をサーベイすること。
  • ラベル付きデータが不足する中で分子表現を再訓練する際の制限要因、特にデータ不足と分布外一般化性能の低さを特定すること。
  • CPMの構成要素である分子記述子、エンコーダー・アーキテクチャ、事前学習目的、および応用分野を体系的にレビューすること。
  • ベンチマーク、モデルの一般化、CPMの理論的理解における未解決課題を強調すること。
  • 3次元幾何構造モデリング、統一アーキテクチャ、単一分子タスクを超えた応用など、未だ十分に検討されていない研究分野を特定し、今後の研究を導くこと。

提案手法

  • CPMsで用いられる分子記述子(フィンガープrint、SMILES配列、2次元/3次元グラフ構造)と、それらのエンコーディング手法を体系的に分類する。
  • グラフニューラルネットワーク(GNNs)、Transformers(例:GROVER、Graphomer)、およびメッセージパッシングとアテンション機構を統合するハイブリッドモデルを含むエンコーダー・アーキテクチャをレビューする。
  • 対照的学習(例:GraphCL、GraphMVP)、マスクされた自己符号化器(例:MCM)、および分子グラフ向けの自己教師付き目的を含む事前学習戦略を分析する。
  • 分子特性予測、ドラッグターゲット相互作用、ドラッグドラッグ相互作用予測など、多様な下流タスクにおけるCPMの性能を評価する。
  • 分布外一般化を重視する評価フレームワークを提案し、例えばスケルトン分割やTherapeutics Data Commons(TDC)ベンチマークの活用を含む。
  • 一貫性のない評価プロトコルやCPMにおける理論的根拠の欠如に起因するメソドロジカルなギャップを、批判的分析を通じて同定する。

実験結果

リサーチクエスチョン

  • RQ1主な分子表現技術とは何か? それぞれのインダクティブバイアスはどのように異なるか?
  • RQ2GNNとTransformersといった異なるエンコーダー・アーキテクチャは、分子構造と特性をどの程度適切に捉えられるか?
  • RQ3一般化可能な分子表現を学習するために、最も効果的な事前学習目的は何か?
  • RQ4なぜ一部のCPMは分布外の分子に対して一般化に失敗するのか? その原因を特定し、是正策を講じるにはどうすればよいか?
  • RQ5CPMの実世界応用における採用を妨げる主なベンチマークと理論的理解のギャップは何か?

主な発見

  • CPMsは、大規模なラベルなし分子データを事前学習に活用することで、微調整を最小限に抑えても優れた性能を発揮するため、データ依存性を顕著に低減する。
  • 成功を収めている一方で、特にMoleculeNetのような小規模な分子データセットでは、乱数シードやデータ分割のばらつきにより一貫性のない評価結果が生じる。
  • 矛盾する結果が存在する(例:人気の高いグラフアテンションネットワーク(GATs)が、その人気にもかかわらず性能が劣ることがある)— これにより、より良いアーキテクチャ設計と目的の整合性の重要性が浮き彫りになる。
  • 対照的学習とマスクされた自己符号化器が主な事前学習戦略として採用されているが、その有効性はタスクによって異なり、一部の研究では非事前学習モデルの方が優れている可能性を示唆する。
  • Therapeutics Data Commons(TDC)は、多様な治療的タスクを想定した現実的で有望なベンチマークを提供しており、分布外一般化のテストを支援する。
  • CPMには理論的基盤が著しく欠如しており、特定の事前学習目的がなぜより良い下流性能をもたらすのかの理解が不十分であるため、メソドロジカルな信頼性と採用の障壁となっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。