Skip to main content
QUICK REVIEW

[论文解读] Precursor recommendation for inorganic synthesis by machine learning materials similarity from scientific literature

Tanjin He, Haoyan Huo|arXiv (Cornell University)|Feb 5, 2023
Machine Learning in Materials Science被引用 4
一句话总结

该论文提出了一种机器学习框架,通过从29,900份文献提取的合成配方中学习化学相似性,推荐无机固态合成的前体材料。利用自监督神经网络对材料组成进行编码,该方法在2,654种未见过的目标材料上实现了82%的成功率,有效将以经验为主的几十年合成知识以可扩展、数据驱动的形式进行编码。

ABSTRACT

Synthesis prediction is a key accelerator for the rapid design of advanced materials. However, determining synthesis variables such as the choice of precursor materials is challenging for inorganic materials because the sequence of reactions during heating is not well understood. In this work, we use a knowledge base of 29,900 solid-state synthesis recipes, text-mined from the scientific literature, to automatically learn which precursors to recommend for the synthesis of a novel target material. The data-driven approach learns chemical similarity of materials and refers the synthesis of a new target to precedent synthesis procedures of similar materials, mimicking human synthesis design. When proposing five precursor sets for each of 2,654 unseen test target materials, the recommendation strategy achieves a success rate of at least 82%. Our approach captures decades of heuristic synthesis data in a mathematical form, making it accessible for use in recommendation engines and autonomous laboratories.

研究动机与目标

  • 自动化实验研究人员常用的基于文献的合成设计过程,这些研究人员通常通过搜索相似材料来复用现有配方。
  • 从大规模文本挖掘的合成配方语料库中学习无机材料之间的化学相似性,实现数据驱动的前体推荐。
  • 开发一种可扩展、可泛化的通用方法,将数十年的启发式合成知识以数学形式、可重用的方式编码,用于自主实验室和推荐系统。
  • 在包含2,654种新型目标材料的大规模历史分割测试集上评估该方法,确保其在案例研究之外的鲁棒性和泛化能力。

提出的方法

  • 训练一个自监督神经网络(PrecursorSelector编码)以基于其前体组成学习材料的向量化表示,从而实现材料相似性的量化。
  • 使用学习到的嵌入向量之间的余弦相似度计算材料相似性,使系统能够识别具有相似合成路径的先例材料。
  • 前体推荐策略从知识库中选择最相似的已知材料,并推荐其前体用于新型目标,模仿人类的类比推理。
  • 模型以多任务神经网络形式训练,并采用自适应损失加权,以联合优化前体选择和材料表征学习。
  • 基线模型包括“最常见”(经验概率)、“Magpie编码”(132个元素性质统计)、“FastText编码”(100维材料文本词嵌入)和“原始组成”(83维元素分数向量)。
  • 数据按发表年份划分(训练集:≤2014年,验证集:2015–2016年,测试集:2017–2020年),并使用原型化学式以防止因重复报告材料导致的数据泄露。

实验结果

研究问题

  • RQ1机器学习模型能否有效从文献挖掘的合成配方中学习化学相似性,以指导新型无机材料的前体选择?
  • RQ2基于神经网络的前体组成表征方法与传统化学编码方法(如Magpie、FastText、原始组成)相比,在前体推荐准确率上表现如何?
  • RQ3数据驱动的类比方法在多大程度上能复现实验化学家在前体选择中使用的启发式推理?
  • RQ4在包含2,654种新型材料的大规模历史未见测试集上,前体推荐的成功率是多少?

主要发现

  • 所提方法在2,654种未见过的目标材料上实现最低82%的前体组合推荐成功率,显著优于基线模型。
  • 基于前体组成学习的PrecursorSelector编码方法在前体推荐准确率上优于传统的Magpie、FastText和原始组成编码方法。
  • 该模型在训练期间未见过的新材料上表现出良好泛化能力,经2017至2020年间发表的1,992种材料的测试集验证。
  • 在前体组成上应用自监督学习,使模型能够捕捉仅从元素性质中难以察觉的复杂非线性合成知识关系。
  • 采用自适应损失加权的多任务学习框架能有效平衡前体选择与表征学习,提升整体推荐性能。
  • 该方法成功地将科学文献中积累的数十年启发式合成知识编码为数学形式,可供人工智能驱动的合成规划和自主实验系统使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。