Skip to main content
QUICK REVIEW

[論文レビュー] Inorganic Materials Synthesis Planning with Literature-Trained Neural Networks

Edward Kim, Zach Jensen|arXiv (Cornell University)|Dec 31, 2018
Machine Learning in Materials Science参考文献 2被引用数 10
ひとこと要約

本論文は、自然言語処理と条件付き変分オートエンコーダー(CVAE)を用いて、科学的文献から無機材料の合成経路を予測する、文献で訓練されたニューラルネットワークフレームワークを提示する。250万件の材料科学論文で訓練されたモデルは、ペロブスカイトの前駆体および反応手順を生成し、スクリーニング対象の83化合物中19化合物が合成可能であることを示した。これは、熱力学を越えた合成傾向を学習できる能力を示している。

ABSTRACT

Leveraging new data sources is a key step in accelerating the pace of materials design and discovery. To complement the strides in synthesis planning driven by historical, experimental, and computed data, we present an automated method for connecting scientific literature to synthesis insights. Starting from natural language text, we apply word embeddings from language models, which are fed into a named entity recognition model, upon which a conditional variational autoencoder is trained to generate syntheses for arbitrary materials. We show the potential of this technique by predicting precursors for two perovskite materials, using only training data published over a decade prior to their first reported syntheses. We demonstrate that the model learns representations of materials corresponding to synthesis-related properties, and that the model's behavior complements existing thermodynamic knowledge. Finally, we apply the model to perform synthesizability screening for proposed novel perovskite compounds.

研究の動機と目的

  • 構造化されたデータベースに依存せずに、非構造化された科学的文献から合成の知見を抽出する汎用的手法の開発を目的とする。
  • 材料科学のジャーナル論文に埋め込まれた膨大で未利用の知識を活用することで、自動合成計画のギャップを埋める。
  • ドメイン知識を明示的に与えずにテキストから合成パターンを学び、新規材料へ一般化可能な移譲可能で自己教師ありのフレームワークの構築を目的とする。
  • 第一原理的熱力学的スクリーニングに加え、文献に裏付けられた合成可能性予測を提供することを目的とする。
  • コミュニティ全体の材料合成分野における研究を加速するために、主要なNLPツールとアノテート済みデータセットをオープンソース化することを目的とする。

提案手法

  • 本手法は、250万件の材料科学ジャーナル論文で訓練されたELMoおよびFastTextの単語埋め込みを用いて、文脈に応じたテキスト表現を実現する。
  • 名前付きエンティティ認識(NER)モデルは、これらの埋め込みを用いて、科学的文献から合成標的物質、前駆体、および反応を同定する。
  • 条件付き変分オートエンコーダー(CVAE)は、標的物質を条件として、合成経路を反応および前駆体の系列としてモデル化する。
  • CVAEは、明示的なドメイン知識を用いずに、物理的・化学的傾向をエンコードする合成経路の潜在表現を学習する。
  • モデルは、学習済み潜在空間からのサンプリングにより合成予測を生成し、前駆体の組成式と反応手順を同時に最適化する。
  • 本フレームワークは、化合物1つあたり10の合成経路を生成し、商業的に入手可能な前駆体を基準にフィルタリングすることで、合成可能性のスクリーニングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1訓練中に見られなかった無機材料の合成経路を、科学的文献のみで訓練されたニューラルネットワークが予測できるか?
  • RQ2モデルが学習した合成経路の表現が、既知の化学的原則や実験的傾向とどの程度相関しているか?
  • RQ31990年代以前の文献のみで訓練された場合、モデルが新規材料(例:ペロブスカイト)へどの程度一般化できるか?
  • RQ4モデルの潜在空間が、構造的または組成的類似性を超えた合成経路間の意味的な類似性を捉えられるか?
  • RQ5第一原理的熱力学的スクリーニングと比較して、文献で訓練されたモデルは、合成可能な材料をどの程度的確に同定できるか?

主な発見

  • 本モデルは、スズ酸ストラトニウム(SrZrO₃)およびバナジウム酸アルミネート(BaAl₂O₄)の初報告以前の文献のみを用いて、前駆体の組み合わせを正しく予測した。
  • CVAEは、固体状態反応において炭酸塩が炭化物よりも好まれる傾向といった化学的傾向を反映した、合成経路の潜在表現を学習した。
  • 潜在合成経路に基づく類似度メトリクスは、結晶構造が異なる場合でも、材料間の意味的な関連性を同定できた。
  • 提案された83種のABO₃ペロブスカイト化合物のうち、商業的に入手可能な前駆体を基準にスクリーニングした結果、19化合物が合成可能とされた。これは、合成可能な候補を効果的に絞り込めたことを示している。
  • モデルの予測は、知られている合成実践(例:ペロブスカイト合成における炭酸塩の使用)と整合しており、そのような規則を明示的に学習していないにもかかわらず妥当であった。
  • オープンソース化されたNERアノテーションと埋め込みは、溶媒や温度の選択を含む、より細分化された合成予測の今後の研究を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。