Skip to main content
QUICK REVIEW

[論文レビュー] Robust Training of Machine Learning Interatomic Potentials with Dimensionality Reduction and Stratified Sampling

Ji Qi, Tsz Wai Ko|arXiv (Cornell University)|Jul 24, 2023
Machine Learning in Materials ScienceMaterials Science被引用数 3
ひとこと要約

本稿では、次元削減と層別抽出を組み合わせたDIRECTサンプリングという手法を紹介する。この手法により、機械学習原子間ポテンシャル(MLIPs)のための頑健で多様性のあるトレーニングデータセットを効率的に選択できる。Materials Projectに収録された100万件を超える構造に対してDIRECTを適用することで、未知の構造配置に一般化性が高く、反復的精錬を必要としない、効率的かつスケーラブルな高スルーレットなモーメントテンソルポテンシャル(MTP)のトレーニングを可能にする、より頑健なM3GNetユニバーサルポテンシャルを構築した。

ABSTRACT

Machine learning interatomic potentials (MLIPs) enable the accurate simulation of materials at larger sizes and time scales, and play increasingly important roles in the computational understanding and design of materials. However, MLIPs are only as accurate and robust as the data they are trained on. In this work, we present DImensionality-Reduced Encoded Clusters with sTratified (DIRECT) sampling as an approach to select a robust training set of structures from a large and complex configuration space. By applying DIRECT sampling on the Materials Project relaxation trajectories dataset with over one million structures and 89 elements, we develop an improved materials 3-body graph network (M3GNet) universal potential that extrapolate more reliably to unseen structures. We further show that molecular dynamics (MD) simulations with universal potentials such as M3GNet can be used in place of expensive extit{ab initio} MD to rapidly create a large configuration space for target materials systems. Combined with DIRECT sampling, we develop a highly reliable moment tensor potential for Ti-H system without the need for iterative optimization. This work paves the way towards robust high throughput development of MLIPs across any compositional complexity.

研究の動機と目的

  • 未知の材料構造配置においても良好に性能を発揮する、頑健で一般化可能な機械学習原子間ポテンシャル(MLIPs)を構築する課題に対処すること。
  • DFT計算の前段階で、多様で情報量の多いトレーニングデータを事前に選択することで、高価な反復的アクティブラーニングへの依存を低減すること。
  • 多成分元素系や水素化物系を含む、複雑な組成空間においても、ユニバーサルMLIPの高スルーレット開発を可能にすること。
  • 体系的なサンプリングにより構造空間を包括的にカバーすることで、MLIPの外挿性能を向上させること。
  • MDシミュレーションによりユニバーサルポテンシャルを用いて、アビ・ニトリア・データ収集を最小限に抑えて新たな材料系の高品質なトレーニングデータを生成できることを示すこと。

提案手法

  • 自動エンコーダーを用いた次元削減により、原子構造の表現を低次元の潜在空間に圧縮し、クラスタリングを効率的に行う。
  • 潜在空間におけるk-meansクラスタリングを用いて、構造空間全体にわたる代表的クラスタを同定する。
  • 層別抽出を実装し、最終的なトレーニングセットにクラスタが割合的に適切に反映されるようにすることで、多様性とカバー範囲を最大化する。
  • M3GNetユニバーサルポテンシャルを用いた分子動力学(MD)シミュレーションとDIRECTサンプリングを組み合わせ、追加の多様な構造をトレーニング用に生成する。
  • DIRECTサンプリングで得たデータセットを用いてM3GNetおよびモーメントテンソルポテンシャル(MTP)モデルをトレーニングし、未学習構造に対する一般化性能を評価する。
  • テストセット(包合化合物やTi-H系を含む)におけるDFTで計算されたエネルギーと力の値を用いて性能を検証する。
Figure 1 : Workflow of DImensionality REduction - Clustering - sTratified (DIRECT) sampling. The standard steps in MLIP development are in black boxes, while the key conceptual improvements proposed in this work are highlighted in purple boxes. The methods in the brackets are those used in the prese
Figure 1 : Workflow of DImensionality REduction - Clustering - sTratified (DIRECT) sampling. The standard steps in MLIP development are in black boxes, while the key conceptual improvements proposed in this work are highlighted in purple boxes. The methods in the brackets are those used in the prese

実験結果

リサーチクエスチョン

  • RQ1次元削減と層別抽出を用いることで、巨大な構造空間から多様で代表的な構造サブセットを効果的に同定できるか?
  • RQ2従来のサンプリング法やアクティブラーニングベースの手法と比較して、DIRECTサンプリングはMLIPの一般化性能と頑健性を向上させるか?
  • RQ3M3GNetのようなユニバーサルポテンシャルを用いたMDシミュレーションにより、事前のDFTデータがなくても、新たな材料系の高品質なトレーニングデータを生成できるか?
  • RQ4DIRECTサンプリングで得たトレーニングセットは、モーメントテンソルポテンシャルのトレーニングにおいて、反復的アクティブラーニングの必要性をどの程度低減できるか?
  • RQ5DIRECTサンプリングでトレーニングされたMLIPは、包合化合物や多元素水素化物のような仮想的・複雑な材料に対し、どの程度の外挿性能を示すか?

主な発見

  • DIRECTサンプリングにより、Materials Projectデータセットに含まれる130万件を超える構造から、多様性と代表性に優れたトレーニングセットを効率的に選択し、DFT計算の回数を大幅に削減した。
  • DIRECTサンプリングでトレーニングされたM3GNetユニバーサルポテンシャルは、標準的またはアクティブラーニングベースのサンプリングでトレーネッドモデルと比較して、未学習構造に対する外挿性能が顕著に向上した。
  • M3GNetユニバーサルポテンシャルを用いたMDシミュレーションにより、27万4千件のTi-H構造を含む大規模で多様なデータセットを効果的に生成でき、反復的最適化を経ずに頑健なモーメントテンソルポテンシャルをトレーニングした。
  • M3GNet-DIRECTポテンシャルは、包合酸素・硫黄含有化合物のテストセットにおいて、平均絶対誤差12.8 meV/atom、最大誤差124.3 meV/atomを達成し、優れた一般化性能を示した。
  • Ti-H系のMTPは、DIRECTサンプリングで得たデータセットを用いてトレーニングされ、500件を超えるテスト構造において平均絶対誤差14.5 meV/atomを達成し、アクティブラーニングの反復処理を一切必要としなかった。
  • DIRECTサンプリングパイプラインはmaml Pythonライブラリとしてオープンソース化され、材料科学分野における再現性と採用を促進した。
(a)
(a)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。