Skip to main content
QUICK REVIEW

[論文レビュー] Keeping it Simple: Language Models can learn Complex Molecular Distributions

Daniel Flam-Shepherd, Kevin Zhu|arXiv (Cornell University)|Dec 6, 2021
Machine Learning in Materials Science被引用数 4
ひとこと要約

本論文は、特にSELFIES分子表現を用いることで、単純な言語モデルが複雑な分子分布を効果的に学習できることを示している。高ペナルティLogP分子の生成、マルチモーダル分布、PubChemからの大規模分子の生成といった挑戦的なタスクにおいて、最先端のグラフベース生成モデルを上回っている。結果は、低データ環境下でも、有効性、一意性、新規性の面で言語モデルが優れた性能を発揮することを示している。

ABSTRACT

Deep generative models of molecules have grown immensely in popularity, trained on relevant datasets, these models are used to search through chemical space. The downstream utility of generative models for the inverse design of novel functional compounds depends on their ability to learn a training distribution of molecules. The most simple example is a language model that takes the form of a recurrent neural network and generates molecules using a string representation. More sophisticated are graph generative models, which sequentially construct molecular graphs and typically achieve state of the art results. However, recent work has shown that language models are more capable than once thought, particularly in the low data regime. In this work, we investigate the capacity of simple language models to learn distributions of molecules. For this purpose, we introduce several challenging generative modeling tasks by compiling especially complex distributions of molecules. On each task, we evaluate the ability of language models as compared with two widely used graph generative models. The results demonstrate that language models are powerful generative models, capable of adeptly learning complex molecular distributions -- and yield better performance than the graph models. Language models can accurately generate: distributions of the highest scoring penalized LogP molecules in ZINC15, multi-modal molecular distributions as well as the largest molecules in PubChem.

研究の動機と目的

  • 既存の生成モデルが困難に感じる複雑な分子分布を、単純な言語モデルが学習できるかを評価すること。
  • SMILESおよびSELFIES表現を用いた言語モデルを、最先端のグラフベース生成モデル(JTVAEおよびCGVAE)と比較すること。
  • 言語モデルが、グラフモデルが失敗するような複雑でマルチモーダルかつ大規模な分子分布にも一般化できるかを調査すること。
  • 分子表現(SMILES対SELFIES)の選択が、モデルの性能および一般化能力に与える影響を評価すること。
  • 今後の研究を促進するためのベンチマークタスクおよびデータセットを提供すること。

提案手法

  • 3つの挑戦的な生成モデリングタスクを構築した:(1) ZINC15からのペナルティ付きLogP分布、(2) 異種の分子タイプ(GDB13, CEP, POLYMERS)を組み合わせたマルチモーダル分布、(3) PubChemからの大規模分子。
  • ドロップアウトと学習率最適化を用いたLSTMアーキテクチャを用いて、RNN言語モデルをSMILESおよびSELFIES文字列表現上で学習した。
  • 2つの標準的なグラフベース生成モデル(JTVAEおよびCGVAE)を用い、同じタスクで直接比較できるように訓練した。
  • 各モデルの性能最適化のため、100の構成をランダムサーチで行い、ハイパーパramーターサーチを実施した。
  • 標準指標(有効性、一意性、新規性、学習データ分布とのワッサーシュタイン距離)を用いてモデルを評価した。
  • SELFIESを採用した。これは文法に整合した分子文字列表現であり、生成された文字列が化学的に有効であることを事前に保証する。

実験結果

リサーチクエスチョン

  • RQ1単純な言語モデルは、最先端のグラフベースモデルが困難に感じる複雑な分子分布を学習できるか?
  • RQ2分子表現の選択(SMILES対SELFIES)が、分子生成における言語モデルの性能および一般化能力に与える影響は何か?
  • RQ3マルチモーダルまたは高分子量の分布からの分子生成において、言語モデルはグラフベースモデルを上回るか?
  • RQ4言語モデルは、訓練データをどれほど記憶し、未学習の有効な分子に一般化できるか?
  • RQ5ペナルティ付きLogPスコアのような微細なエネルギー/性質の差異を持つ分布を、言語モデルは効果的に学習できるか?

主な発見

  • SELFIESで学習した言語モデルは、すべてのタスクでSMILESベースのRNNを上回り、特に大規模タスクで高い有効性、一意性、新規性を示した。
  • SMILESベースのRNNは学習データとのワッサーシュタイン距離が高く、顕著な記憶化を示したが、SELFIES RNNはやや悪いワッサーシュタイン指標であったにもかかわらず、より良い一般化を示した。
  • グラフベースモデル(JTVAEおよびCGVAE)は、ペナルティ付きLogPタスクで主要モードを学習できず、PubChemの最大分子では学習が不可能だった。
  • JTVAEは、環のみの分子や非環状分子を含む多様なツリー構造を学習する必要があったため、マルチディストリビューションタスクで苦戦した。
  • CGVAEは、学習中に1つのサンプルトレースしか使用しないため、多様な生成トレースを学習するのが困難であり、マルチディストリビューションタスクで失敗した。
  • 言語モデルは、3つの複雑な分布すべてから分子を効果的に生成でき、最高スコアのペナルティ付きLogP分子および最大のPubChem分子を含む、強力な一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。