Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning for Molecular Design Guided by Quantum Mechanics

Gregor N. C. Simm, Robert Pinsler|arXiv (Cornell University)|Feb 18, 2020
Machine Learning in Materials Science参考文献 37被引用数 21
ひとこと要約

本稿では、3次元デカルト座標上で直接動作する強化学習フレームワークを提案し、原子をキャンバス上に逐次配置することで、クラスターおよび非有機分子を含む多様な分子構造の生成を可能にする。この手法は、物理的根拠に基づく報酬関数として量子化学的エネルギー計算を用い、新しい環境であるMolGymにおいて回転および平行移動不変な方策ネットワークを用いて成功した学習を達成し、生成された分子の妥当性と構造的安定性が高く保たれている。

ABSTRACT

Automating molecular design using deep reinforcement learning (RL) holds the promise of accelerating the discovery of new chemical compounds. Existing approaches work with molecular graphs and thus ignore the location of atoms in space, which restricts them to 1) generating single organic molecules and 2) heuristic reward functions. To address this, we present a novel RL formulation for molecular design in Cartesian coordinates, thereby extending the class of molecules that can be built. Our reward function is directly based on fundamental physical properties such as the energy, which we approximate via fast quantum-chemical methods. To enable progress towards de-novo molecular design, we introduce MolGym, an RL environment comprising several challenging molecular design tasks along with baselines. In our experiments, we show that our agent can efficiently learn to solve these tasks from scratch by working in a translation and rotation invariant state-action space.

研究の動機と目的

  • 強化学習におけるグラフベースの分子生成の限界を克服すること。これは、モデルが単一の有機分子に限定され、ヒューリスティックな報酬関数に依存することを意味する。
  • グラフ表現ではなく3次元デカルト空間で動作させることで、クラスターや無機化合物を含む複雑な分子系の設計を可能にすること。
  • 電子的エネルギーを高速な量子化学的手法で近似することで、基本的な物理的性質に基づいた報酬関数を構築すること。
  • MolGymを導入し、多様な分子設計タスクと量子化学に基づくベースラインを備えたベンチマーク環境を提供すること。
  • 平行移動および回転に対して不変な方策ネットワークアーキテクチャを設計し、3次元分子空間における安定的かつ汎用的な学習を可能にすること。

提案手法

  • エージェントは、状態が原子の座標を表し、行動がキャンバス上の特定の3次元位置に原子を配置することに対応するマルコフ決定過程で動作する。
  • 状態表現は、相対座標および原子間距離を入力特徴として用いることで、平行移動および回転に対して不変にされる。
  • 報酬関数は、量子力学的エネルギーに由来し、PM6半経験的手法を用いて計算され、エージェントが低エネルギーで安定した分子配置へと誘導される。
  • メッセージパッシング層を用いて原子間相互作用を符号化しつつ、全般的な平行移動および回転に対して不変性を保つ、新規なアクターキャリブレーションニューラルネットワークアーキテクチャが提案されている。
  • 訓練には標準的な方策勾配法(例:PPO)が用いられ、エージェントのポリシーをエンドツーエンドで最適化する。探索は確率的行動サンプリングによって実現される。
  • MolGym環境には、単一分子形成、マルチバッグ合成、溶媒和モデリングなどのタスクが含まれており、それぞれが定められた化学 stoichiometry とベースライン性能指標を備えている。

実験結果

リサーチクエスチョン

  • RQ1デカルト座標上での強化学習は、グラフベース手法の範囲を超えて、安定的かつ妥当な分子構造を生成できるか?
  • RQ2量子化学的エネルギーに基づく物理的根拠のある報酬関数は、ヒューリスティックな記述子と比較して、生成された分子の品質および安定性を向上させられるか?
  • RQ3並進および回転に対して不変な方策ネットワークは、事前の構造的インダクティブバイアスなしに、3次元分子空間で分子設計タスクを完全に新しい状態から学習できるか?
  • RQ4本手法は、クラスターまたは複数成分を有する分子のような、より大きなまたはより複雑な分子系へどの程度スケーリング可能か?
  • RQ5妥当性、多様性、構造的安定性の観点から、既存のベンチマークと比較して、エージェントの性能はどの程度か?

主な発見

  • C2H2O2タスクでは90%の妥当性を達成し、さまざまなシングルバッグタスクでは70–90%の妥当性を示した。中央値RMSDは0.5 Å未満であり、高い構造的安定性を示している。
  • マルチバッグタスクでは22個のユニークで妥当な分子が生成され、中央値RMSDは0.05 Åであった。これは、複雑なマルチコンponents系においても効果的な学習が可能であることを示している。
  • 溶媒和タスクでは80–90%の妥当性と、RMSD中央値0.92–1.06 Åを達成し、溶媒相互作用のモデリング能力を示している。
  • C7H8N2O2タスクでは最大61個のユニークな分子が生成され、ターゲット式の複雑さにもかかわらず、強い多様性を示している。
  • 並進および回転に対して不変な方策ネットワークにより、幾何的教師信号を明示的に必要とせずに、さまざまな分子タスクにおいて安定した学習と一般化が可能になった。
  • 量子化学的エネルギーを報酬関数として用いることで、エネルギー最小化による後処理でも確認されたように、低エネルギーで安定した分子配置が生成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。