[論文レビュー] A Transformer-based Generative Model for De Novo Molecular Design
本論文では、タンパク質標的を条件として用いることで、新しい有効なSMILES文字列を生成する条件付きTransformerベースの生成モデルcTransformerを提案する。このモデルは標的特異的埋め込みを活用し、薬物様性と標的特異性を両立した化合物の生成を実現した。モデルは、薬物様性および標的特異性の両面で最先端の性能を達成しており、有効性、一意性、新規性が高く、既知の活性化合物と同一の化学的空間を占める分子を生成した。
In the scope of drug discovery, the molecular design aims to identify novel compounds from the chemical space where the potential drug-like molecules are estimated to be in the order of 10^60 - 10^100. Since this search task is computationally intractable due to the unbounded search space, deep learning draws a lot of attention as a new way of generating unseen molecules. As we seek compounds with specific target proteins, we propose a Transformer-based deep model for de novo target-specific molecular design. The proposed method is capable of generating both drug-like compounds (without specified targets) and target-specific compounds. The latter are generated by enforcing different keys and values of the multi-head attention for each target. In this way, we allow the generation of SMILES strings to be conditional on the specified target. Experimental results demonstrate that our method is capable of generating both valid drug-like compounds and target-specific compounds. Moreover, the sampled compounds from conditional model largely occupy the real target-specific molecules' chemical space and also cover a significant fraction of novel compounds.
研究の動機と目的
- 創薬における膨大な化学空間($10^{60}$–$10^{100}$ 個の潜在的薬物様分子)を探索する計算上の非効率性に対処するため。
- 望ましい標的特異的性質を有する新規で有効かつ薬物様性のある分子構造を生成できる深層生成モデルの開発を目的とする。
- 標的タンパク質に基づく条件付き分子生成を、標的埋め込みを組み込んだアテンション機構を用いて実現する。
- 既存モデルを改善し、有効性・一意性に加え、新規性および生物学的活性を有する化合物の生成を実現する。
- 各標的に対応する既知の活性化合物と同一のサブ化学的空間を占める分子を生成できるかどうかを検証する。
提案手法
- モデルは、標的情報なしでMOSESデータセット上で事前学習されたTransformerデコーダー・アーキテクチャを用いる。この段階で、一般的な薬物様SMILESパターンを学習する。
- 条件付き微調整段階では、標的特異的埋め込みをマルチヘッドアテンション機構に統合し、標的がキーおよび値として機能することで生成プロセスを条件づける。
- モデルは3つの標的特異的データセット(EGFR、HTR1A、S1PR1)で微調整され、標的埋め込みがデコーダーの自己アテンションおよびクロスアテンション層に挿入される。
- SMILES文字列は自己回帰的に1トークンずつ生成され、文法的正しさと化学的有効性が保証される。
- 有効性、一意性(unique@10k)、新規性(トレーニングセットに存在しない割合)といった指標を用いてモデルの性能を評価する。
- 活性予測と生成化合物の強度をベンチマークするため、2048ビットのFCFP6フィンガープrint、166ビットのMACCSキーフィンガープリント、319個のRDKit記述子を用いたQSARモデルを用いる。
実験結果
リサーチクエスチョン
- RQ1Transformerベースのモデルは、非条件設定下でも有効で、新規かつ薬物様性のあるSMILES文字列を生成できるか?
- RQ2アテンション機構に標的特異的埋め込みを統合することで、望ましい標的アフィニティを持つ分子の生成を効果的に誘導できるか?
- RQ3生成された分子は、標的の既知の活性化合物と同一の化学的空間を占めているか?
- RQ4cRNNベースラインと比較して、モデルの活性化合物生成性能はどの程度優れているか?
- RQ5生成された分子は、高い予測活性を維持しつつ、どの程度の新規性を示すか?
主な発見
- cTransformerモデルは、全標的で88%以上の有効性を達成し、EGFRでは10,000個の生成分子のうち94%が一意、HTR1Aでは89.6%、S1PR1では83.8%の高い一意性を示した。
- モデルは顕著な新規性を示し、EGFRでは90%、HTR1Aでは78.7%、S1PR1では68.4%の分子がトレーニングセットに存在しないものであった。これはcRNNベースラインを著しく上回った。
- QSARモデルによる予測で、全標的でピアソン相関係数0.75以上を達成し、モデルが高予測活性を持つ化合物を生成できる能力を裏付けた。
- cTransformerが生成した上位1,000~5,000個の活性化合物は、全3標的にcRNNと比較して顕著に優れた予測活性分布を示した。
- UMAP可視化により、生成された標的特異的分子(濃い色)と実際の標的特異的化合物(薄い色)が同一のサブ化学的空間に位置していることが確認され、生物学的関連性が裏付けられた。
- 各標的に対応する上位24個の活性の高い生成化合物が同定・可視化され、モデルが高ポテンシャルな候補を生成できる能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。