Skip to main content
QUICK REVIEW

[论文解读] TransPolymer: a Transformer-based language model for polymer property predictions

Changwen Xu, Yuyang Wang|arXiv (Cornell University)|Sep 3, 2022
Machine Learning in Materials Science被引用 4
一句话总结

TransPolymer 是一种基于 Transformer 的语言模型,采用化学感知分词技术,通过掩码语言建模从大规模未标注聚合物序列中学习,实现对聚合物性质的高精度、数据高效预测。它在十个基准数据集上达到最先进性能,证明了自注意力机制和预训练在捕捉聚合物序列依赖关系方面的有效性。

ABSTRACT

Accurate and efficient prediction of polymer properties is of great significance in polymer design. Conventionally, expensive and time-consuming experiments or simulations are required to evaluate polymer functions. Recently, Transformer models, equipped with self-attention mechanisms, have exhibited superior performance in natural language processing. However, such methods have not been investigated in polymer sciences. Herein, we report TransPolymer, a Transformer-based language model for polymer property prediction. Our proposed polymer tokenizer with chemical awareness enables learning representations from polymer sequences. Rigorous experiments on ten polymer property prediction benchmarks demonstrate the superior performance of TransPolymer. Moreover, we show that TransPolymer benefits from pretraining on large unlabeled dataset via Masked Language Modeling. Experimental results further manifest the important role of self-attention in modeling polymer sequences. We highlight this model as a promising computational tool for promoting rational polymer design and understanding structure-property relationships from a data science view.

研究动机与目标

  • 开发一种深度学习模型,实现在不依赖昂贵实验或模拟的情况下,对聚合物性质进行高精度、高效率的预测。
  • 通过利用 Transformer 的序列建模能力,解决现有模型(如 RNN、GNN 和手工设计的指纹)的局限性。
  • 探究自注意力机制和在大规模未标注聚合物序列上进行预训练,是否能够提升聚合物科学中的泛化能力和表征学习效果。
  • 通过受自然语言建模启发的框架,建立数据驱动的方法,以理解聚合物中结构-性质关系。

提出的方法

  • 设计了一种具有化学感知能力的自定义聚合物分词器,将聚合物序列转换为保留化学语义和连接关系的标记。
  • 模型架构基于标准的 Transformer 编码器,利用多头自注意力机制和前馈网络,以捕捉聚合物序列中的长程依赖关系。
  • 采用基于正弦函数的位置编码,以保留序列顺序,因为模型不具备循环结构。
  • 预训练采用掩码语言建模(MLM)方法,其中 15% 的标记被掩码(80%)、替换为随机标记(10%)或保持不变(10%),以学习上下文表征。
  • 微调阶段在下游聚合物性质预测任务上使用单层 MLP 回归头,采用 AdamW 优化器和学习率调度策略。
  • 应用逐层权重学习率衰减(LLRD)策略以优化微调过程,允许顶层使用较高的学习率,深层则使用较低的学习率。

实验结果

研究问题

  • RQ1基于 Transformer 的语言模型是否能有效学习聚合物序列的有意义表征以用于性质预测?
  • RQ2通过掩码语言建模在大规模未标注聚合物序列上进行预训练,是否能提升下游性质预测性能?
  • RQ3与 RNN 和 GNN 相比,Transformer 中的自注意力机制在建模具有可变聚合度的聚合物序列时表现如何?
  • RQ4化学感知分词在多大程度上增强了模型捕捉化学语法规则和结构模式的能力?
  • RQ5该模型是否能在无需大量重新训练的情况下,跨多种聚合物类别和性质类型实现良好泛化?

主要发现

  • TransPolymer 在十个多样化的聚合物性质预测基准数据集上达到最先进性能,优于先前方法,包括 GNN、RNN 和基于指纹的模型。
  • 在大规模未标注数据集上进行预训练后,通过微调显著提升了性能,证实了自监督预训练的优势。
  • 预训练阶段采用掩码语言建模使模型能够学习化学语法规则和上下文依赖关系,表现为二元交叉熵损失在 30 个周期内从超过 1 稳定下降至约 0.07。
  • 自注意力机制对捕捉聚合物序列中的长程相互作用至关重要,消融实验证明移除注意力机制后性能显著下降。
  • 该模型在不同聚合物类型和性质类别(包括机械、热学和电学性质)间表现出强大的泛化能力。
  • 在更大规模数据集上进行预训练可带来性能提升,模型准确率随预训练数据规模增加而提高,显示出良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。