Skip to main content
QUICK REVIEW

[論文レビュー] SPICE, A Dataset of Drug-like Molecules and Peptides for Training Machine Learning Potentials

Peter Eastman, Pavan Kumar Behara|arXiv (Cornell University)|Sep 21, 2022
Machine Learning in Materials Science被引用数 13
ひとこと要約

SPICEは、薬物様分子、ジペプチド、および溶媒化アミノ酸の110万を超えるコンフォメーションを含む大規模な量子化学データセットであり、ωB97M-D3(BJ)/def2-TZVPPDレベルの理論で計算されている。このデータセットにより、共有結合および非共有結合相互作用を含む多様な化学空間において、化学的精度に達する機械学習ポテンシャルの訓練が可能となり、力、エネルギー、電気双極子モーメント、および共有結合次数が提供されることで、移譲性があり高精度なシミュレーションが可能になる。

ABSTRACT

Machine learning potentials are an important tool for molecular simulation, but their development is held back by a shortage of high quality datasets to train them on. We describe the SPICE dataset, a new quantum chemistry dataset for training potentials relevant to simulating drug-like small molecules interacting with proteins. It contains over 1.1 million conformations for a diverse set of small molecules, dimers, dipeptides, and solvated amino acids. It includes 15 elements, charged and uncharged molecules, and a wide range of covalent and non-covalent interactions. It provides both forces and energies calculated at the ωB97M-D3(BJ)/def2-TZVPPD level of theory, along with other useful quantities such as multipole moments and bond orders. We train a set of machine learning potentials on it and demonstrate that they can achieve chemical accuracy across a broad region of chemical space. It can serve as a valuable resource for the creation of transferable, ready to use potential functions for use in molecular simulations.

研究の動機と目的

  • 生体分子シミュレーションにおける機械学習ポテンシャルの訓練に向けた、高品質で多様なデータセットの不足に対処すること。
  • 薬物様小分子、ジマー、ジペプチド、および溶媒化アミノ酸をカバーする包括的なデータセットを提供し、多様な電子的および立体的環境を含めること。
  • タンパク質-リガンド相互作用に適用可能な移譲性のある機械学習ポテンシャルの訓練を支援すること。
  • 力、エネルギー、電気双極子モーメント、共有結合次数を含む、高精度な量子化学データを提供し、モデルの訓練を強化すること。
  • 広範な化学空間にわたり、化学的精度に達する機械学習ポテンシャルの開発を可能にすること。

提案手法

  • 多様な小分子、ジペプチド、および溶媒化アミノ酸を対象に、体系的およびランダムなサンプリングを用いて110万を超えるコンフォメーションを生成する。
  • 全エネルギーおよび解析的力が含まれるωB97M-D3(BJ)/def2-TZVPPDレベルの理論で電子構造特性を計算する。
  • 電子的および結合特性の学習を強化するために、電気双極子モーメントや共有結合次数などの追加特性を含める。
  • 15種類の元素(帯電および不帯電種を含む)を用いて、広範な化学的カバレッジを確保する。
  • 標準アーキテクチャを用いてデータセット上で複数の機械学習ポテンシャルを訓練し、移譲性と精度を評価する。
  • 共有結合および非共有結合相互作用を含む多様な化学的環境での性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1薬物様分子およびペプチドの大型で多様なデータセットは、化学的精度に達する機械学習ポテンシャルの訓練を可能にするか?
  • RQ2SPICEで訓練された機械学習ポテンシャルは、非共有結合相互作用およびイオン性種を含む、さまざまな種類の分子相互作用にどの程度一般化可能か?
  • RQ3電気双極子モーメントや共有結合次数といった補助的特性の組み込みが、訓練済みモデルの移譲性および精度をどのように向上させるか?
  • RQ4SPICEデータセットは、生体分子シミュレーションに即座に使用可能な移譲性のある機械学習ポテンシャルの開発を支援できるか?
  • RQ5SPICEで訓練されたモデルは、多様な化学的環境において共有結合および非共有結合相互作用をどの程度的確に捉えられるか?

主な発見

  • SPICEデータセットには、薬物様分子、ジマー、ジペプチド、および溶媒化アミノ酸の110万を超えるコンフォメーションが含まれており、広範な化学空間をカバーしている。
  • 量子化学計算はωB97M-D3(BJ)/def2-TZVPPDレベルで実施され、高精度なエネルギーと解析的力が得られた。
  • データセットには15種類の元素、帯電および不帯電種、多様な共有結合および非共有結合相互作用が含まれている。
  • 電子構造の学習を強化するために、電気双極子モーメントや共有結合次数といった補足的特性が提供されている。
  • SPICEで訓練された機械学習ポテンシャルは、広範な分子配置および相互作用タイプにおいて化学的精度に達している。
  • このデータセットにより、タンパク質とリガンドを含む分子シミュレーションに適した、移譲性があり即時使用可能な機械学習ポテンシャルの開発が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。