Skip to main content
QUICK REVIEW

[论文解读] BERT Learns (and Teaches) Chemistry

Josh Payne, M. Sammer Srouji|arXiv (Cornell University)|Jul 11, 2020
Machine Learning in Materials Science参考文献 34被引用 21
一句话总结

该论文提出使用BERT结合分子的SMILES字符串表示,通过注意力机制分析自动识别化学相关的亚结构(如官能团),而无需依赖领域特定的启发式规则。结果表明,BERT的注意力头能够突出显示影响分子性质的亚结构,且在溶解度、类药性及合成可及性等任务上微调BERT后,可产生可解释的、具有化学意义的注意力模式,尤其在溶解度预测方面表现突出。

ABSTRACT

Modern computational organic chemistry is becoming increasingly data-driven. There remain a large number of important unsolved problems in this area such as product prediction given reactants, drug discovery, and metric-optimized molecule synthesis, but efforts to solve these problems using machine learning have also increased in recent years. In this work, we propose the use of attention to study functional groups and other property-impacting molecular substructures from a data-driven perspective, using a transformer-based model (BERT) on datasets of string representations of molecules and analyzing the behavior of its attention heads. We then apply the representations of functional groups and atoms learned by the model to tackle problems of toxicity, solubility, drug-likeness, and synthesis accessibility on smaller datasets using the learned representations as features for graph convolution and attention models on the graph structure of molecules, as well as fine-tuning of BERT. Finally, we propose the use of attention visualization as a helpful tool for chemistry practitioners and students to quickly identify important substructures in various chemical properties.

研究动机与目标

  • 以数据驱动方式自动识别分子中具有化学意义的亚结构,而无需依赖手工规则或领域专业知识。
  • 探究BERT的注意力机制是否能够学习到影响分子性质(如溶解度、毒性及类药性)的官能团。
  • 评估BERT学习到的表征作为图神经网络的输入特征,以及在下游化学回归任务上微调的实用性。
  • 开发注意力可视化作为可解释工具,帮助化学家识别分子性质中的关键亚结构。
  • 探究在大规模SMILES数据上预训练是否能使BERT学习到超越标准原子特征化的化学意义明确的表征。

提出的方法

  • 在大规模SMILES字符串数据集上微调BERT,以学习原子和亚结构的上下文表征。
  • 分析BERT各层中的注意力头,识别在预测任务中获得高注意力的原子或亚结构。
  • 将BERT学习到的表征作为图卷积和自注意力模型在分子图上的输入特征,用于预测溶解度、类药性及合成可及性。
  • 直接在ZINC15数据集上对BERT进行回归任务(如QED、SAS、溶解度)的微调,以评估性能和注意力行为。
  • 可视化注意力矩阵,以解释哪些分子片段对特定化学性质最具影响力。
  • 提出一种对比损失,以促使BERT在同分子的不同SMILES表示间学习一致的嵌入表示,提升结构感知能力。

实验结果

研究问题

  • RQ1BERT的注意力机制是否能在无需先验领域知识的情况下自动识别分子中的化学相关亚结构?
  • RQ2BERT学习到的表征是否能提升溶解度、类药性及合成可及性等分子性质预测任务的性能?
  • RQ3当在不同化学回归任务上微调时,BERT中的注意力模式如何变化?
  • RQ4注意力可视化能否作为化学家识别分子性质中关键官能团的实用可解释性工具?
  • RQ5在大规模SMILES数据上预训练是否能带来比标准原子特征化更稳健、更具化学意义的表征?

主要发现

  • 经过在溶解度任务上微调后,BERT的注意力头对已知影响性质的亚结构表现出直观的注意力聚焦,表明其具备有意义的模式识别能力。
  • 在回归任务上微调BERT后性能优于从随机权重训练的模型,表明预训练提供了有用的归纳偏置。
  • 不同任务的注意力模式总体相似,但在溶解度任务中第10和第11层表现出显著差异,表明存在任务特异性的注意力学习。
  • 尽管性能未优于标准原子特征化,BERT学习到的嵌入表征在捕捉完整分子图信息方面仍存在局限。
  • 尽管性能增益有限,注意力可视化仍揭示了可解释且化学上合理的亚结构聚焦,支持其作为可解释性工具的实用性。
  • 作者观察到,未在BERT词汇表中的稀有原子影响甚微,表明模型对词汇表限制具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。