Skip to main content
QUICK REVIEW

[論文レビュー] Robust data-driven approach for predicting the configurational energy of high entropy alloys

Jiaxin Zhang, Xianglin Liu|arXiv (Cornell University)|Aug 10, 2019
High Entropy Alloys Studies参考文献 51被引用数 9
ひとこと要約

本稿では、第一原理計算データが限られている状況でも、精度の高い不確実性を伴う予測が可能な、高エントロピー合金(HEAs)における配置エネルギーの予測を目的とした、ロバストなベイズ的データ駆動フレームワークを提案する。有効対相互作用(EPI)とアンサンブルサンプリングを用い、ベイズ正則化回帰とベイズ情報量基準(BIC)に基づく特徴選択を組み合わせることで、NbMoTaW、NbMoTaWV、NbMoTaWTiのHEAsにおいて、1 meV未満のエネルギー誤差を達成し、安定したパラメータ推定が可能である。

ABSTRACT

High entropy alloys (HEAs) have been increasingly attractive as promising next-generation materials due to their various excellent properties. It's necessary to essentially characterize the degree of chemical ordering and identify order-disorder transitions through efficient simulation and modeling of thermodynamics. In this study, a robust data-driven framework based on Bayesian approaches is proposed and demonstrated on the accurate and efficient prediction of configurational energy of high entropy alloys. The proposed effective pair interaction (EPI) model with ensemble sampling is used to map the configuration and its corresponding energy. Given limited data calculated by first-principles calculations, Bayesian regularized regression not only offers an accurate and stable prediction but also effectively quantifies the uncertainties associated with EPI parameters. Compared with the arbitrary determination of model complexity, we further conduct a physical feature selection to identify the truncation of coordination shells in EPI model using Bayesian information criterion. The results achieve efficient and robust performance in predicting the configurational energy, particularly given small data. The developed methodology is applied to study a series of refractory HEAs, i.e. NbMoTaW, NbMoTaWV and NbMoTaWTi where it is demonstrated how dataset size affects the confidence we can place in statistical estimates of configurational energy when data are sparse.

研究の動機と目的

  • 第一原理データが限られている状況でも、高エントロピー合金(HEAs)における配置エネルギーを予測するロバストでデータ駆動的な手法の開発。
  • 統計的基準に基づく物理的特徴選択を用いて、多成分系におけるモデルの複雑さと過学習の課題に取り組む。
  • モンテカルロシミュレーションによる順序・無秩序転移の解析に用いるためのサーヴェイゲートハミルトニアンの信頼性と精度の向上。
  • 有効対相互作用(EPI)パラメータの不確実性を定量化し、データセットサイズへの感受性を評価する。
  • 複雑な配置空間において、アンサンブルサンプリングがデータの代表性を高めることの有効性を示す。

提案手法

  • 指定された数の配位殻までをカバーする原子間対相互作用に基づき、配置エネルギーを表現する有効対相互作用(EPI)モデルを採用する。
  • ベイズ正則化回帰を用いて、第一原理DFT計算エネルギーに適合するEPIパラメータを推定し、不確実性の定量化と相関推定を可能にする。
  • ベイズ情報量基準(BIC)を用いて、最適な配位殻の切断を特定する物理的特徴選択を実施する。
  • 短距離秩序と長距離秩序が異なる複数のスーパセルを組み合わせたアンサンブルサンプリング戦略を実装し、データの代表性を向上させる。
  • 訓練データセットサイズを変化させた交差検証を実施し、モデルのロバスト性と汎化性能を評価する。
  • EPIパラメータの分散・共分散行列を分析し、配位殻間の依存関係と安定性を評価する。

実験結果

リサーチクエスチョン

  • RQ1第一原理データが限られている状況で、高エントロピー合金における配置エネルギーをどのようにして高精度に予測できるか?
  • RQ2異なるデータセットサイズに対して、EPIモデルに含める最適な配位殻の数は何か?
  • RQ3BICを用いたベイズ的特徴選択は、任意のモデル切断に比べてどのようにモデルのロバスト性を向上させるか?
  • RQ4データセットサイズがEPIパラメータ推定の不確実性と安定性に与える影響はどの程度か?
  • RQ5アンサンブルサンプリングは、多成分HEAsの複雑な配置空間を効果的に代表することができるか?

主な発見

  • 提案されたベイズフレームワークは、すべての3つのHEAs(NbMoTaW、NbMoTaWV、NbMoTaWTi)で1原子あたりの平均二乗誤差(RMSE)が1 meV未満に抑えられ、非常に高い予測精度を達成した。
  • BICに基づく特徴選択により、小規模データセット(nt < 100)ではm=2–3、中規模データセット(100 ≤ nt ≤ 400)ではm=5–6、大規模データセット(nt > 400)ではm=6–9が最適な配位殻数であることが判明し、過学習と不足学習が軽減された。
  • データセットサイズをnt=100からnt=400に増加させた際、特に最近隣接殻のEPIパラメータの不確実性が顕著に減少し、パラメータの安定性が向上した。
  • 分散・共分散行列の分析から、独立性を仮定したにもかかわらず、最近隣接殻内に非自明な相関が存在することが判明し、相関を考慮したモデリングの重要性が示された。
  • アンサンブルサンプリング戦略は、単一のスーパセルを用いたサンプリングに比べてRMSEの標準偏差が低く(ε < 1 meV)なっており、データの代表性が向上していることを示している。
  • NbMoTaWVでは、BICで特定されたm=9の配位殻を用いたモデルが、任意のm=7選択よりも優れた性能を示し、BICによる選択が複雑な系でさえも不足学習を回避することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。