Skip to main content
QUICK REVIEW

[论文解读] Recent advances in the Self-Referencing Embedding Strings (SELFIES) library

Alston Lo, Robert Pollice|PubMed|Feb 7, 2023
Machine Learning in Materials ScienceMaterials Science参考文献 21被引用 3
一句话总结

本论文介绍了 selfies 2.1.1,这是一个增强版的开源 Python 库,用于自引用嵌入字符串(SELFIES),一种100%语法和语义鲁棒的分子字符串表示方法。该库通过使用带有自引用函数的上下文无关语法,实现了无错误的有效分子生成,实现了快速的往返转换(30万分子仅需252秒),并支持可定制、高效且可扩展的分子生成,无需后期过滤。

ABSTRACT

String-based molecular representations play a crucial role in cheminformatics applications, and with the growing success of deep learning in chemistry, have been readily adopted into machine learning pipelines. However, traditional string-based representations such as SMILES are often prone to syntactic and semantic errors when produced by generative models. To address these problems, a novel representation, SELF-referencing embedded strings (SELFIES), was proposed that is inherently 100% robust, alongside an accompanying open-source implementation called selfies. Since then, we have generalized SELFIES to support a wider range of molecules and semantic constraints, and streamlined its underlying grammar. We have implemented this updated representation in subsequent versions of selfies, where we have also made major advances with respect to design, efficiency, and supported features. Hence, we present the current status of selfies (version 2.1.1) in this manuscript. Our library, selfies, is available at GitHub (https://github.com/aspuru-guzik-group/selfies).

研究动机与目标

  • 解决基于字符串的分子表示方法(如 SMILES)在生成式机器学习模型中常见的语法和语义错误问题。
  • 扩展 SELFIES 表示法,以支持 SMILES 的所有主要特性,包括复杂官能团、环状结构和支链,同时保持100%的有效性。
  • 提升开源 selfies 库的性能、可用性和可扩展性,以实现与多样化机器学习和化学信息学工作流的集成。
  • 通过可定制的字符集和语法约束,在无需后期处理过滤的情况下,实现大规模、有效且多样的分子结构生成。
  • 为未来将 SELFIES 扩展至聚合物、晶体、非共价体系及反应表示奠定基础。

提出的方法

  • SELFIES 表示法使用 Chomsky 类型-2 的上下文无关语法,并通过引入自引用函数来编码分子分支和环的形成,确保所有生成的字符串在化学上均有效。
  • 该库实现了确定性的推导过程,通过递归解析自引用并应用价键约束,将 SELFIES 字符串转换为分子图。
  • 核心编码函数 encoder() 将任意有效 SELFIES 字符串映射为规范化的 SMILES 字符串,而 decoder() 则执行反向转换,实现往返转换。
  • 字符集可自定义:用户可过滤掉低化合价原子或多重键,以在随机生成过程中控制分子大小分布。
  • 实现完全自包含,无需外部依赖,并包含用于转换、验证和语法自定义的实用函数。
  • 在 DTP 开放化合物集(30万分子)上进行了性能基准测试,测量了往返转换时间随分子大小的变化。
Figure 2: The roundtrip translation time of 1000 randomly-sampled S MILES strings from the DTP open compound collection as a function of size, measured in number of atoms.
Figure 2: The roundtrip translation time of 1000 randomly-sampled S MILES strings from the DTP open compound collection as a function of size, measured in number of atoms.

实验结果

研究问题

  • RQ1如何使基于字符串的分子表示方法在生成式机器学习模型中天然具备对语法和语义错误的鲁棒性?
  • RQ2SELFIES 语法在多大程度上能够支持 SMILES 表示法的所有主要特性,包括复杂分支、环状结构和官能团?
  • RQ3SELFIES 转换的性能如何随分子大小扩展?大规模数据集的往返转换计算成本是多少?
  • RQ4SELFIES 中的可定制字符集能否在无需后期过滤的情况下控制生成分子的大小和多样性?
  • RQ5哪些关键设计原则和实现策略使得一个自包含的分子字符串库能够实现高性能和可扩展性?

主要发现

  • 将30万个分子从 SMILES 转换为 SELFIES 再转回 SMILES 的往返转换耗时252秒(编码136秒,解码116秒),证明了其高效性。
  • 使用基础字符集随机生成的 SELFIES 字符串因高化合价或多重键符号的过早终止,主要生成小分子。
  • 通过过滤掉多重键和低化合价原子,字符集显著提高了平均分子大小,从而能够生成更大且有效的分子。
  • 解码函数成功将1000个随机采样的 SELFIES 字符串全部转换为有效 SMILES 字符串,无任何失败,证实了100%的鲁棒性。
  • 该库的性能与分子大小呈线性关系,翻译时间与分子中的原子数成比例增加。
  • 该实现完全自包含且无依赖,可无缝集成到多样化的机器学习和化学信息学流水线中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。