Skip to main content
QUICK REVIEW

[論文レビュー] MOFSimplify: Machine Learning Models with Extracted Stability Data of Three Thousand Metal-Organic Frameworks

Aadrita Nandy, Gianmarco Terrones|arXiv (Cornell University)|Sep 16, 2021
Metal-Organic Frameworks: Synthesis and Applications被引用数 6
ひとこと要約

本稿では、3,000体の金属有機フレームワーク(MOFs)の文献から溶媒除去安定性および熱分解データを自然言語処理(NLP)を用いて抽出する機械学習フレームワーク、MOFSimplifyを紹介する。グラフ構造および孔の幾何学的特徴に基づいて学習されたモデルは、不確実性の定量的評価を伴うMOF安定性の予測を実施し、コミュニティからのフィードバックとアクティブラーニングを可能にするWebインターフェースを提供する。

ABSTRACT

We report a workflow and the output of a natural language processing (NLP)-based procedure to mine the extant metal-organic framework (MOF) literature describing structurally characterized MOFs and their solvent removal and thermal stabilities. We obtain over 2,000 solvent removal stability measures from text mining and 3,000 thermal decomposition temperatures from thermogravimetric analysis data. We assess the validity of our NLP methods and the accuracy of our extracted data by comparing to a hand-labeled subset. Machine learning (ML, i.e. artificial neural network) models trained on this data using graph- and pore-geometry-based representations enable prediction of stability on new MOFs with quantified uncertainty. Our web interface, MOFSimplify, provides users access to our curated data and enables them to harness that data for predictions on new MOFs. MOFSimplify also encourages community feedback on existing data and on ML model predictions for community-based active learning for improved MOF stability models.

研究の動機と目的

  • 文献における金属有機フレームワーク(MOFs)のための大規模かつキュレートされた安定性データの不足に対処すること。
  • 科学的テキストから溶媒除去および熱安定性データを抽出するスケーラブルな自然言語処理(NLP)パイプラインの開発。
  • 抽出されたデータに基づいて、不確実性の定量的評価を伴うMOF安定性を予測する機械学習モデルの訓練。
  • データのアクセスおよびコミュニティ主導のモデル改善を可能にする公開Webプラットフォーム、MOFSimplifyの構築。
  • データおよびモデル予測に関するコミュニティフィードバックを通じたアクティブラーニングを活用し、安定性モデルを段階的に改善すること。

提案手法

  • 文献に記載された3,000体の構造的に特徴付けられたMOFsから、溶媒除去安定性および熱分解温度を抽出するためにカスタムNLPパイプラインを採用。
  • 手動ラベル付けされたデータサブセットと比較することで、NLP抽出の正確性を検証。
  • MOFsをグラフベースおよび孔の幾何学的特徴記述子を用いて表現し、構造的およびトポロジカル特徴を符号化。
  • 構造的表現を入力特徴として用い、抽出されたデータに基づいて人工ニューラルネットワークを訓練。
  • 機械学習予測に不確実性の定量的評価を統合し、モデルの信頼性を評価。
  • キュレートされたデータセットをホスティングし、ユーザーによるアクセス、予測、フィードバックを可能にするWebインターフェース(MOFSimplify)をデプロイ。

実験結果

リサーチクエスチョン

  • RQ1NLP技術は、MOFsに関する非構造的科学文献から溶媒除去および熱安定性データを信頼性高く抽出できるか?
  • RQ2NLPで抽出されたデータは、専門家がラベル付けした基準と比較してどの程度正確か?
  • RQ3グラフおよび孔の幾何学的特徴に基づく表現を用いた機械学習は、MOF安定性をどの程度正確に予測できるか?
  • RQ4本データに基づいて訓練された機械学習モデルは、未知のMOFsの安定性を不確実性の定量的評価とともに予測できるか?
  • RQ5コミュニティからのフィードバックは、アクティブラーニングを通じてMOF安定性モデルの予測性能を向上させるためにどの程度効果的か?

主な発見

  • NLPパイプラインは、文献から2,000件を超える溶媒除去安定性測定値および3,000件の熱分解温度を効果的に抽出した。
  • 手動ラベル付けされたサブセットとの比較により、NLP抽出プロセスの高い正確性が確認された。
  • グラフおよび孔の幾何学的特徴に基づくモデルを用いた機械学習モデルは、不確実性の定量的評価を伴う信頼性の高いMOF安定性予測を達成した。
  • MOFSimplify Webプラットフォームは、新規MOFsのリアルタイム予測を可能にするとともに、モデルの最適化を支援するコミュニティフィードバックをサポートする。
  • コミュニティフィードバックの統合により、アクティブラーニングが実現され、時間の経過とともにモデルの頑健性および一般化性能が向上した。
  • データセットおよびモデルは公開されており、今後のMOF安定性予測分野の研究基盤を形成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。