Skip to main content
QUICK REVIEW

[論文レビュー] Infusing Linguistic Knowledge of SMILES into Chemical Language Models

Ingoo Lee, Hojung Nam|arXiv (Cornell University)|Apr 20, 2022
Computational Drug Discovery Methods被引用数 9
ひとこと要約

本論文では、サブ構造とその文法的関係を解析することで、SMILESから得られる言語的知識を統合するトランスフォーマー基盤の化学言語モデルを提案する。サブ構造トークンでの事前学習と、知識アダプタを用いた接続性/タイプ知識のインジェクションにより、分子性質予測において最先端の性能を達成し、注意メカニズムの解釈可能性と文法理解が向上した。

ABSTRACT

The simplified molecular-input line-entry system (SMILES) is the most popular representation of chemical compounds. Therefore, many SMILES-based molecular property prediction models have been developed. In particular, transformer-based models show promising performance because the model utilizes a massive chemical dataset for self-supervised learning. However, there is no transformer-based model to overcome the inherent limitations of SMILES, which result from the generation process of SMILES. In this study, we grammatically parsed SMILES to obtain connectivity between substructures and their type, which is called the grammatical knowledge of SMILES. First, we pretrained the transformers with substructural tokens, which were parsed from SMILES. Then, we used the training strategy 'same compound model' to better understand SMILES grammar. In addition, we injected knowledge of connectivity and type into the transformer with knowledge adapters. As a result, our representation model outperformed previous compound representations for the prediction of molecular properties. Finally, we analyzed the attention of the transformer model and adapters, demonstrating that the proposed model understands the grammar of SMILES.

研究の動機と目的

  • SMILESの生成プロセスに起因する、分子構造表現における本質的限界を是正すること。
  • SMILESからの文法的構造とサブ構造の接続性を組み込むことで、分子表現学習を向上させること。
  • サブ構造レベルでの事前学習と知識インジェクションを通じて、SMILES文法を理解できるトランスフォーマー基盤のモデルを開発すること。
  • インジェクションされた言語的知識が、分子性質予測におけるモデルの性能と解釈可能性を向上させるかどうかを評価すること。

提案手法

  • SMILESを文法的に解析し、サブ構造とその接続性タイプを抽出することで、構造化されたサブ構造トークンを生成した。
  • 大規模な化学データから分子文法を学習できるよう、これらのサブ構造トークン上でトランスフォーマー・モデルを事前学習した。
  • 同じ化合物の複数のSMILES表現を活用することで表現学習を強化する「同じ化合物モデル」訓練戦略を採用した。
  • 接続性およびサブ構造タイプ情報の知識アダプタを介してトランスフォーマーに統合し、言語的知識の的確なインジェクションを可能にした。
  • 標準的な転移学習プロトコルに従い、分子性質予測ベンチマークでモデルを微調整した。
  • 注目メカニズムの分析により、モデルが文法的に意味のあるサブ構造に注目するよう学習していることを検証した。

実験結果

リサーチクエスチョン

  • RQ1SMILESの文法的解析は、トランスフォーマー基盤のモデルにおける分子表現学習を改善できるか?
  • RQ2知識アダプタを用いてサブ構造の接続性およびタイプ情報をインジェクションすることで、分子性質予測タスクにおけるモデル性能が向上するか?
  • RQ3注目パターンから示されるように、モデルはどの程度構造的に意味のあるサブ構造に注目するよう学習しているか?
  • RQ4予測精度と一般化性能の観点から、本手法は既存のSMILESベースのモデルと比較してどのように差をつけるか?

主な発見

  • 提案手法は、分子性質予測ベンチマークにおいて、従来の化合物表現手法を上回り、最先端の性能を示した。
  • 注目可視化により、モデルが文法的に関連するサブ構造に注目するよう学習していることが確認され、構造的理解が向上していることが示された。
  • 知識アダプタの使用により、言語的知識が効果的にトランスフォーマーにインジェクションされ、より解釈可能で正確な表現が得られた。
  • 「同じ化合物モデル」訓練戦略により、同じ分子の多様なSMILES表現をモデルに提示することで、表現の質が向上した。
  • サブ構造レベルでの事前学習により、標準的なSMILESトークン化に比べ、より良い一般化性能とロバスト性が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。