Skip to main content
QUICK REVIEW

[論文レビュー] Learning Over Molecular Conformer Ensembles: Datasets and Benchmarks

Yanqiao Zhu, JeeHyun Hwang|arXiv (Cornell University)|Sep 29, 2023
Machine Learning in Materials Science被引用数 6
ひとこと要約

本稿では、DFTで計算されたボルツマン平均化された性質を有する分子および反応をカバーする4つの多様なデータセットを備えた、分子コンフォーマー集合学習のための包括的ベンチマークであるMARCELを紹介する。コンフォーマー集合を明示的にモデル化することで、1次元、2次元、3次元の分子表現学習モデルにおいて、特にコンフォーメーショナルな柔軟性を含むタスク(触媒設計や反応選択性予測など)において性能が著しく向上することを示している。

ABSTRACT

Molecular Representation Learning (MRL) has proven impactful in numerous biochemical applications such as drug discovery and enzyme design. While Graph Neural Networks (GNNs) are effective at learning molecular representations from a 2D molecular graph or a single 3D structure, existing works often overlook the flexible nature of molecules, which continuously interconvert across conformations via chemical bond rotations and minor vibrational perturbations. To better account for molecular flexibility, some recent works formulate MRL as an ensemble learning problem, focusing on explicitly learning from a set of conformer structures. However, most of these studies have limited datasets, tasks, and models. In this work, we introduce the first MoleculAR Conformer Ensemble Learning (MARCEL) benchmark to thoroughly evaluate the potential of learning on conformer ensembles and suggest promising research directions. MARCEL includes four datasets covering diverse molecule- and reaction-level properties of chemically diverse molecules including organocatalysts and transition-metal catalysts, extending beyond the scope of common GNN benchmarks that are confined to drug-like molecules. In addition, we conduct a comprehensive empirical study, which benchmarks representative 1D, 2D, and 3D molecular representation learning models, along with two strategies that explicitly incorporate conformer ensembles into 3D MRL models. Our findings reveal that direct learning from an accessible conformer space can improve performance on a variety of tasks and models.

研究の動機と目的

  • 既存の分子表現学習(MRL)モデルが分子を静的構造として扱い、その動的コンフォーメーショナルな柔軟性を無視しているという限界を是正すること。
  • コンフォーマー集合を明示的にモデル化することで、単一コンフォーマーや2次元グラフベースのアプローチを上回る性能向上が分子および反応性質予測において達成されるかどうかを評価すること。
  • 有機触媒、遷移金属錯体、反応エナンチオマー選択性をカバーする多様で高品質なデータセットを備えた標準化されたベンチマークを確立すること。
  • 1次元、2次元、3次元のモデルが、コンフォーマー集合と単一コンフォーマに対してそれぞれどのように性能を発揮するかを比較すること。
  • 3次元MRLモデルに集合情報を統合する2つの戦略(集合平均化とアテンションベースの集約)の相対的利点を調査すること。

提案手法

  • 著者らは、DFTで最適化されたコンフォーマー集合とボルツマン平均化されたターゲット性質を有する4つのデータセット(Drugs-75K、Kraken、EE、BDE)を構築した。
  • 各データセットは、異なる化学的空間をカバーする:医薬品様分子(Drugs-75K)、有機ホスファルルイゲン(Kraken)、Rh触媒を用いたエナンチオマー選択性反応(EE)、Pd触媒を用いた酸化付加反応(BDE)。
  • ベンチマークは、分子グラフ、単一コンフォーマ、または完全な集合から、集合平均性質を予測する1次元(例:SMILESベース)、2次元(グラフベース)、3次元(幾何)モデルを評価する。
  • 2つの集合対応戦略が導入された:(1) コンフォーマの予測値を平均化し、(2) 各コンフォーマがターゲット性質に与える寄与度に基づいて重みを付けるアテンション機構を用いる。
  • すべてのモデルは標準的なMRLプロトコルに従って訓練・評価され、テスト分割におけるRMSEやR²などの回帰指標によって性能が測定された。
  • モデルタイプ間のアーキテクチャ的差異とは独立して、集合モデル化の影響を特定するためのアブレーション解析が含まれている。

実験結果

リサーチクエスチョン

  • RQ12次元グラフニューラルネットワークは、明示的な集合入力を得ない限り、分子のコンフォーメーショナルな柔軟性をどれほどうまく内蔵的にモデル化できるか?
  • RQ2明示的にコンフォーマの集合をモデル化することで、電子親和性や結合エネルギーなど、コンフォーメーションに敏感な性質の予測精度が向上するか?
  • RQ31次元、2次元、3次元の異なるモデルアーキテクチャが、コンフォーマー集合と単一コンフォーマに対してそれぞれどのように性能を発揮するか?
  • RQ4平均化とアテンションベースの重み付けという2つの集合統合戦略のうち、どの戦略が多様な分子タスクにおいてより優れた一般化性能を示すか?
  • RQ5DFTで最適化されたコンフォーマー集合が推論時に利用できない場合でも、集合ベースのMRLモデルは、未観測のコンフォーマー分布に一般化できるか?

主な発見

  • コンフォーマー集合を明示的にモデル化することで、すべてのモデルタイプで一貫した性能向上が得られ、特にコンフォーメーショナルに感受性の高いタスクでは3次元モデルが最大の相対的改善を示した。
  • アテンションベースの集合集約戦略は、単純な平均化を上回り、特にエナンチオマー選択性予測のような高いコンフォーメーショナルばらつきを示すタスクで顕著な優位性を示した。
  • 2次元GNNは、明示的な集合入力が与えられない限り、コンフォーメーショナル効果を内蔵的にモデル化する能力が限定的であり、その恩恵は集合入力が提供された場合にのみ観察された。
  • DFTで最適化されたコンフォーマーが推論時に入手不可能なBDEデータセットでは、Open Babelで生成されたコンフォーマーを用いて訓練されたモデルで依然として高い性能が達成されており、不完全なコンフォーマー集合に対してもロバストであることが示された。
  • MARCELベンチマークは、標準的なMRLベンチマークがコンフォーメーショナルに柔軟な系の評価には不十分であることを明らかにし、集合対応評価の必要性を強調した。
  • 本研究は、ボルツマン平均化された性質が、単一コンフォーマー予測よりも、特に触媒的および電子的性質においてより予測能が優れていることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。