Skip to main content
QUICK REVIEW

[論文レビュー] Do Large Scale Molecular Language Representations Capture Important Structural Information

Jerret Ross, Brian Belgodere|arXiv (Cornell University)|Jun 17, 2021
Computational Drug Discovery Methods参考文献 59被引用数 11
ひとこと要約

本稿では、11億個のラベルなしSMILES配列を用いて線形アテンション機構を用いて効率的で並列化された学習が可能な大規模な分子言語モデル、MoLFormerを紹介する。このモデルは構造的情報を効果的に捉え、QM8およびQM9の性質予測ベンチマークで競争力ある性能を達成しており、微調整によりさらなる向上が得られる。

ABSTRACT

Predicting chemical properties from the structure of a molecule is of great importance in many applications including drug discovery and material design. Machine learning based molecular property prediction holds the promise of enabling accurate predictions at much less complexity, when compared to, for example Density Functional Theory (DFT) calculations. Features extracted from molecular graphs, using graph neural nets in a supervised manner, have emerged as strong baselines for such tasks. However, the vast chemical space together with the limited availability of labels makes supervised learning challenging, calling for learning a general-purpose molecular representation. Recently, pre-trained transformer-based language models (PTLMs) on large unlabeled corpus have produced state-of-the-art results in many downstream natural language processing tasks. Inspired by this development, here we present molecular embeddings obtained by training an efficient transformer encoder model, referred to as MoLFormer. This model was employed with a linear attention mechanism and highly paralleized training on 1D SMILES sequences of 1.1 billion unlabeled molecules from the PubChem and ZINC datasets. Experiments show that the learned molecular representation performs competitively, when compared to existing graph-based and fingerprint-based supervised learning baselines, on the challenging tasks of predicting properties of QM8 and QM9 molecules. Further task-specific fine-tuning of the MoLFormerr representation improves performance on several of those property prediction benchmarks. These results provide encouraging evidence that large-scale molecular language models can capture sufficient structural information to be able to accurately predict quantum chemical properties and beyond.

研究の動機と目的

  • 大規模事前学習分子言語モデルが、量子化学的性質を予測するための基本的な構造的情報を捉えられるかどうかを調査すること。
  • 分子性質予測におけるラベル付きデータの限界を補うために、膨大な量のラベルなし分子コーパスを用いた自己教師付き事前学習の手法を提案すること。
  • グラフベースの表現に依存せずに、大規模な分子配列に対してスケーラブルに学習可能な効率的なトランスフォーマーに基づくモデルを開発すること。
  • 学習された分子埋め込みの一般化能力および転移可能性を、多様な分子性質予測タスクにおいて評価すること。

提案手法

  • PubChemおよびZINCデータセットから得た11億個のラベルなしSMILES配列を用いて、一般用途の分子表現を学習するトランスフォーマー・エンコーダー・モデルMoLFormerを訓練する。
  • 計算複雑度を低減し、長大なSMILES配列における高度な並列化学習を可能にするために、線形アテンション機構を採用する。
  • 自然言語処理の事前学習パラダイムに類似した、マスクされたトークンを予測するマスク言語モデルの目的関数を事前学習段階で用いる。
  • 標準的なベンチマーク(QM8およびQM9を含む)を用いて、微調整を介して下流の性質予測タスクにおける学習済み表現を評価する。
  • 表現品質を評価するために、グラフニューラルネットワークおよびフィンガープrintベースの教師ありベースラインと性能を比較する。
  • 特定の量子化学的性質予測タスクの性能向上を図るため、MoLFormerの埋め込みにタスク固有の微調整を適用する。

実験結果

リサーチクエスチョン

  • RQ1SMILES配列上で学習された大規模なトランスフォーマー基盤の言語モデルは、量子化学的性質予測に必要な基本的な構造的情報を捉えた分子表現を学習できるか?
  • RQ2標準的な分子性質予測ベンチマークにおいて、MoLFormerの性能は確立されたグラフベースおよびフィンガープrintベースの教師ありベースラインと比べてどうなるか?
  • RQ3事前学習済みのMoLFormer表現の微調整が、下流の性質予測タスクにおける性能向上にどの程度寄与するか?
  • RQ4線形アテンション機構は、表現品質を損なうことなく、大規模な分子言語モデルの効果的で効率的な学習を可能にするか?

主な発見

  • MoLFormerはQM8およびQM9の分子性質予測ベンチマークで競争力ある性能を達成しており、SMILES配列における大規模言語モデル学習が強力な汎用分子表現を生み出せることを示している。
  • 事前学習済みのMoLFormer埋め込みは複数の性質予測タスクにうまく一般化され、教師ありグラフニューラルネットワークおよびフィンガープリントベース手法と同等またはそれ以上の性能を発揮している。
  • MoLFormer表現の微調整により、複数のベンチマークで性能が向上しており、その優れた転移性と下流タスクへの適応可能性が示されている。
  • 線形アテンションの使用により、大規模なSMILESデータに対する効率的で高度に並列化された学習が可能となり、数十億個の分子に対する事前学習が現実可能になった。
  • 結果から、大規模分子言語モデルが、正確な量子化学的性質予測に必要な構造的および化学的情報を効果的に捉えられることの強い証拠が得られた。
  • モデルの性能から、SMILESベースの言語モデル学習は、グラフベースまたはフィンガープリントベースのアプローチと同等に、分子表現学習の有効な代替手段であることが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。