Skip to main content
QUICK REVIEW

[論文レビュー] Accurate Prediction of Experimental Band Gaps from Large Language Model-Based Data Extraction

Samuel Yang, Shutong Li|arXiv (Cornell University)|Nov 23, 2023
Machine Learning in Materials Science被引用数 7
ひとこと要約

本論文は、科学文献からの実験的バンドギャップデータを抽出する大規模言語モデル(LLM)ベースのパイプラインを提示しており、従来の自動化手法と比較して著しく低い誤差率を達成している。純粋で単一結晶性のバルク材料に限定してフィルタリングし、その結果得られた高品質なデータセットで学習することで、既存のヒューマンカスタマイズ済みデータベースと比較して平均絶対誤差を19%低減した。

ABSTRACT

Machine learning is transforming materials discovery by providing rapid predictions of material properties, which enables large-scale screening for target materials. However, such models require training data. While automated data extraction from scientific literature has potential, current auto-generated datasets often lack sufficient accuracy and critical structural and processing details of materials that influence the properties. Using band gap as an example, we demonstrate Large language model (LLM)-prompt-based extraction yields an order of magnitude lower error rate. Combined with additional prompts to select a subset of experimentally measured properties from pure, single-crystalline bulk materials, this results in an automatically extracted dataset that's larger and more diverse than the largest existing human-curated database of experimental band gaps. Compared to the existing human-curated database, we show the model trained on our extracted database achieves a 19% reduction in the mean absolute error of predicted band gaps. Finally, we demonstrate that LLMs are able to train models predicting band gap on the extracted data, achieving an automated pipeline of data extraction to materials property prediction.

研究の動機と目的

  • 機械学習モデルの材料科学分野におけるトレーニングデータの不足と不正確さを解決すること。
  • 材料特性に関する科学文献からの自動データ抽出の信頼性を向上させること。
  • 全本文論文からの実験的バンドギャップを抽出するスケーラブルで低誤差のパイプラインを開発すること。
  • LLMで抽出されたデータが、既存のカスタマイズ済みデータベースでトレーニングされたモデルを上回る性能を示すことを実証すること。
  • 文献から特性予測に至るエンドツーエンドの自動ワークフローを確立すること。

提案手法

  • 大規模言語モデル(LLM)を用いて、少数の例提示(few-shot prompting)により科学論文からのバンドギャップ値を抽出する。
  • さらにLLMのプロンプトを適用し、実験的に測定された純粋で単一結晶性のバルク材料に限定して抽出する。
  • フィルタリングされたLLM抽出データから、実験的バンドギャップの大規模かつ多様なデータセットを構築する。
  • LLM抽出データセット上で機械学習モデルをトレーニングし、バンドギャップ予測を行う。
  • 最大の既存のヒューマンカスタマイズ済みデータベースと比較して、モデルのパフォーマンスを検証する。
  • 複数段階のLLMプロンプト戦略を用いて、データ品質を向上させ、ノイズを低減する。

実験結果

リサーチクエスチョン

  • RQ1LLMベースのデータ抽出は、既存の自動化手法と比較して、バンドギャップ抽出においてより低い誤差率を達成できるか?
  • RQ2LLM抽出データを純粋で単一結晶性のバルク材料に限定することで、データ品質と予測性能が向上するか?
  • RQ3LLM抽出データでトレーニングされた機械学習モデルは、ヒューマンカスタマイズ済みデータベースでトレーニングされたモデルを上回る性能を示せるか?
  • RQ4LLM抽出データセットの規模と多様性は、既存のカスタマイズ済みデータベースと比べてどの程度か?
  • RQ5科学文献から材料特性予測に至るエンドツーエンドの自動パイプラインを構築することは可能か?

主な発見

  • LLMベースの抽出手法は、従来の自動データ抽出技術と比較して、10倍も低い誤差率を達成した。
  • 得られたデータセットは、最大の既存のヒューマンカスタマイズ済みデータベースよりも大規模かつ多様性に富んでいる。
  • LLM抽出データセットでトレーニングされたモデルは、ヒューマンカスタマイズ済みデータベースでトレーニングされたモデルと比較して、バンドギャップ予測の平均絶対誤差を19%低減した。
  • LLMパイプラインは、純粋で単一結晶性のバルク材料の実験的バンドギャップを高い正確性で同定・フィルタリングするのに成功した。
  • 本研究は、LLMを用いた科学文献から正確な材料特性予測に至る完全自動化でスケーラブルなパイプラインを実証した。
  • LLM抽出データセットによる性能向上は、データの品質と代表性がモデルの正確性にとって極めて重要であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。