Skip to main content
QUICK REVIEW

[論文レビュー] Recent advances in the Self-Referencing Embedding Strings (SELFIES) library

Alston Lo, Robert Pollice|PubMed|Feb 7, 2023
Machine Learning in Materials ScienceMaterials Science参考文献 21被引用数 3
ひとこと要約

本論文は、自己参照埋め込み文字列(SELFIES)の100%構文的・意味的に堅牢な分子文字列表現である、selfies 2.1.1を提示する。これは自己参照関数を備えた文脈自由文法を用いることで、誤りのない有効な分子の生成を可能にする、オープンソースのPythonライブラリである。高速な往復翻訳(30万分子で252秒)を実現し、後処理のフィルタリングを必要とせず、カスタマイズ可能で効率的かつ拡張可能な分子生成を可能にする。

ABSTRACT

String-based molecular representations play a crucial role in cheminformatics applications, and with the growing success of deep learning in chemistry, have been readily adopted into machine learning pipelines. However, traditional string-based representations such as SMILES are often prone to syntactic and semantic errors when produced by generative models. To address these problems, a novel representation, SELF-referencing embedded strings (SELFIES), was proposed that is inherently 100% robust, alongside an accompanying open-source implementation called selfies. Since then, we have generalized SELFIES to support a wider range of molecules and semantic constraints, and streamlined its underlying grammar. We have implemented this updated representation in subsequent versions of selfies, where we have also made major advances with respect to design, efficiency, and supported features. Hence, we present the current status of selfies (version 2.1.1) in this manuscript. Our library, selfies, is available at GitHub (https://github.com/aspuru-guzik-group/selfies).

研究の動機と目的

  • 生成型機械学習モデルにおいて一般的に生じる、SMILESのような文字列ベースの分子表現における構文的・意味的誤りを是正すること。
  • 複雑な機能性基準、環、分岐を含む、SMILESの主な特徴をすべてサポートするようにSELFIES表現を拡張すること。同時に100%の有効性を維持すること。
  • 多様な機械学習およびケモインフォマティクスワークフローへの統合を可能にする、オープンソースのselfiesライブラリのパフォーマンス、使いやすさ、拡張性を向上させること。
  • 後処理フィルタリングを必要とせず、カスタマイズ可能なアトムと文法制約を用いて、大規模で有効かつ多様な分子構造を生成できること。
  • 将来のSELFIESの拡張の基盤を築くこと。ポリマー、結晶、共有結合でない系、反応表現への対応を含む。

提案手法

  • SELFIES表現は、分子の分岐および環形成を符号化するために自己参照関数を備えたチョムスキー型2の文脈自由文法を用い、生成されたすべての文字列が化学的に有効であることを保証する。
  • ライブラリは、自己参照を再帰的に解決し、結合価制約を適用することで、SELFIES文字列を分子グラフに翻訳する決定的導出プロセスを実装している。
  • コア関数のencoder()は、任意の有効なSELFIES文字列を標準化されたSMILES文字列にマッピングする。decoder()は逆のプロセスを実行し、往復翻訳を可能にする。
  • アトムのアルファベットはカスタマイズ可能である。低結合価の原子や多重結合を除外することで、乱数生成時の分子サイズ分布を制御できる。
  • 実装は自己完結的であり、外部依存性を一切必要とせず、翻訳、検証、文法カスタマイズのためのユーティリティ関数を含む。
  • パフォーマンスベンチマークは、DTPオープン化合物コレクション(30万分子)を対象に実施され、分子サイズの関数として往復翻訳時間を測定した。
Figure 2: The roundtrip translation time of 1000 randomly-sampled S MILES strings from the DTP open compound collection as a function of size, measured in number of atoms.
Figure 2: The roundtrip translation time of 1000 randomly-sampled S MILES strings from the DTP open compound collection as a function of size, measured in number of atoms.

実験結果

リサーチクエスチョン

  • RQ1生成型機械学習モデルにおける構文的および意味的誤りに対して、文字列ベースの分子表現をどのように本質的に堅牢にすることができるか?
  • RQ2SELFIES文法は、複雑な分岐、環、機能性基準を含む、SMILES表現の主な特徴をどの程度までサポートできるか?
  • RQ3SELFIES翻訳のパフォーマンスは分子サイズにどのようにスケーリングするか?また、大規模データセットにおける往復翻訳の計算コストはどの程度か?
  • RQ4SELFIESにおけるカスタマイズ可能なアトムアルファベットを用いて、後処理フィルタリングを必要とせず、生成された分子のサイズと多様性を制御できるか?
  • RQ5高いパフォーマンスと拡張性を実現するための、自己完結型分子文字列ライブラリにおける主要な設計原則と実装戦略は何か?

主な発見

  • SMILESからSELFIESに、そして再びSMILESに戻す30万分子の往復翻訳に252秒(エンコード136秒、デコード116秒)を要し、高い効率性を示した。
  • 基本的なアトムアルファベットを用いたランダム生成されたSELFIES文字列は、高結合価や多重結合記号による早期終了のため、主に小さな分子となった。
  • 多重結合および低結合価の原子をアルファベットから除外することで、平均分子サイズが顕著に増加し、より大きな有効な分子の生成が可能になった。
  • 1,000個のランダムに抽出されたSELFIES文字列をすべて正常に有効なSMILES文字列に変換できた。これは100%の堅牢性を裏付けた。
  • ライブラリのパフォーマンスは分子サイズに比例して線形にスケーリングされ、翻訳時間は分子に含まれる原子数に比例して増加した。
  • 実装は完全に自己完結的かつ依存関係フリーであり、多様な機械学習およびケモインフォマティクスパイプラインへのシームレスな統合を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。