Skip to main content
QUICK REVIEW

[論文レビュー] On Deriving Probabilistic Models for Adsorption Energy on Transition Metals using Multi-level Ab initio and Experimental Data

Huijie Tian, Srinivas Rangarajan|arXiv (Cornell University)|Jan 26, 2019
Gaussian Processes and Bayesian Inference参考文献 3被引用数 5
ひとこと要約

本論文は、低精度のDFTデータと高精度のRPAまたは実験データを融合することで、遷移金属における吸着エネルギーを高い精度で予測するマルチタスクガウス過程(MT-GP)フレームワークを提案する。豊富な低精度データを活用し、限られた高精度データを的確に統合することで、単一タスクモデルに比べて著しく優れた性能を達成し、高精度データ点の必要数を最大80%まで削減しながら、平均絶対誤差0.12 eV未満を維持する。

ABSTRACT

In this paper, we apply multi-task Gaussian Process (MT-GP) to show that the adsorption energy of small adsorbates on transition metal surfaces can be modeled to a high level of fidelity using data from multiple sources, taking advantage of the relatively abundant ''low fidelity" data (such as from density functional theory computations) and small amounts of ''high fidelity" computational (e.g. using the random phase approximation) or experimental data. To fully explore the performance of MT-GP, we perform two case studies - one using purely computational datasets and the other using a combination of experimental and computational datasets. In both cases, the performance of MT-GPs is significantly better than single-task models built on a single data source. This method can be used to learn improved models from fused datasets, and thereby build accurate models under tight computational and experimental budget.

研究の動機と目的

  • 複数の理論的・実験的データレベルを統合することで、遷移金属表面における吸着エネルギーの予測精度を向上させるデータ駆動型モデルの開発。
  • RPAなどの高レベル理論の計算的ボトル neck を軽減するため、低精度DFTデータを事前分布として用い、高価な高精度データへの依存度を低減する。
  • マルチタスクガウス過程が、独立したデータソースに訓練された単一タスクモデルを上回ることを示す。
  • アクティブラーニングを用いて、最も情報価値の高い高精度データ点を選択することで、実験的または計算的コストを最小限に抑えるデータ取得の最適化。
  • 純粋に計算的および実験的・計算的ハイブリッドデータセットの両方でモデルを検証し、データの信頼性レベルにかかわらず高い頑健性を示す。

提案手法

  • 複数の信頼性レベル(例:PBE、BEEF-vdW(低精度DFT)、RPA(高精度理論)、実験測定)のデータソースを用いて、吸着エネルギーをマルチタスクガウス過程(MT-GP)回帰でモデル化する。
  • 異なる信頼性レベル間の相関をモデル化するカーネル関数を用い、低精度タスクから高精度タスクへの情報伝達を可能にする。
  • パスフィンガープrintや電子的構造特徴(例:dバンド中心)を用いて、表面種の化学的環境を表面固有に表現する。
  • 予測分散を収集基準としてアクティブラーニングを適用し、反復的に最も情報価値の高い高精度データ点(例:FC-RPA)を選択することで、必要な高精度サンプル数を最小限に抑える。
  • FC-PBE、FC-BEEFなどのソースタスクと、FC-RPAまたは実験データなどのターゲットタスクの組み合わせを用いてMT-GPを訓練し、交差検証と平均絶対誤差(MAE)や予測標準偏差の平均(MPSd)などの誤差指標を用いて評価する。
  • 10分割交差検証を用いてモデル性能を評価し、個々のデータソースに訓練された単一タスクGPモデルと比較することで、性能向上の程度を定量化する。

実験結果

リサーチクエスチョン

  • RQ1マルチタスクガウス過程は、低精度DFTデータと高精度RPAまたは実験データを効果的に統合し、遷移金属における吸着エネルギーの予測精度を向上させることができるか?
  • RQ2低精度データの量を増加させることで、目標となる予測精度に到達するための高精度データ点の必要数はどのように変化するか?
  • RQ3ランダムサンプリングと比較して、アクティブラーニングは、モデル性能を維持しつつ、必要な高精度データ点の数をどの程度削減できるか?
  • RQ4低精度汎関数の選択(例:PBE対BEEF-vdW)が、MT-GPモデルの性能および一般化能力に与える影響はいかほどか?
  • RQ5MT-GPモデルは、単一のデータソース(例:RPAのみ、または実験データのみ)に訓練された単一タスクモデルに比べ、予測精度と不確実性評価の両面で優れているか?

主な発見

  • FC-PBEとFC-BEEFをソースタスクとして用いたMT-GPモデルは、FC-RPAターゲットセットで平均絶対誤差(MAE)0.12 eVを達成し、単一タスクモデルを著しく上回った。
  • FC-PBEデータ点200個をソースとして用いることで、MT-GPは、FC-RPA全データセットを用いた単一タスクGPと同等の精度を、10個未満のFC-RPAデータ点で達成した。
  • FC-RPAデータ点60個のみを用いても、FC-PBE全データセットと180個のFC-RPAデータ点で訓練されたモデルと同等のMAEに近い精度を達成し、高精度データの必要数を67%削減した。
  • MT-GPにおける予測標準偏差の平均(MPSd)は、初期段階でデータ不足のため誤差をやや低く見積もるが、後続段階ではMAEをよく追跡する信頼性の高い不確実性推定器として機能し、アクティブラーニングの早期終了を可能にした。
  • MT-GPにおけるFC-BEEFとFC-RPAの相関は、FC-PBEとFC-RPAの相関よりも強かった。これは、BEEF-vdWが表面科学データにパラメータ化されているため、系統的誤差が低減されるためと推測される。
  • 低精度データ点の数が増加するにつれ、目標精度に到達するための高精度データ点の必要数が減少した—例として、FC-PBEデータ点100個では140個のFC-RPA点が必要だったが、200個では60個にまで減少した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。