Skip to main content
QUICK REVIEW

[論文レビュー] Seq2Mol: Automatic design of de novo molecules conditioned by the target protein sequences through deep neural networks

Ahmadreza Ghanbarpour, Markus A. Lill|arXiv (Cornell University)|Oct 29, 2020
Computational Drug Discovery Methods参考文献 18被引用数 5
ひとこと要約

この論文では、ELMo埋め込みと強化学習を用いたLSTMベースの生成器を用いて、標的タンパク質配列に条件づけられた新しい分子を生成する深層学習手法Seq2Molを紹介する。モデルは、リガンドの事前知識がなくても、G蛋白共役型膜受容体(GPCRs)およびチロシンキナーゼの既知の結合体よりも顕著に類似した、構造的に多様で薬物様性を持つ化合物を生成する。

ABSTRACT

De novo design of molecules has recently enjoyed the power of generative deep neural networks. Current approaches aim to generate molecules either resembling the properties of the molecules of the training set or molecules that are optimized with respect to specific physicochemical properties. None of the methods generates molecules specific to a target protein. In the approach presented here, we introduce a method which is conditioned on the protein target sequence to generate de novo molecules that are relevant to the target. We use an implementation adapted from Google's "Show and Tell" image caption generation method, to generate SMILES strings of molecules from protein sequence embeddings generated by a deep bi-directional language model ELMo. ELMo is used to generate contextualized embedding vectors of the protein sequence. Using reinforcement learning, the trained model is further optimized through augmented episodic likelihood to increase the diversity of the generated compounds compared to the training set. We used the model to generate compounds for two major drug target families, i.e. for GPCRs and Tyrosine Kinase targets. The model generated compounds which are structurally different form the training set, while also being more similar to compounds known to bind to the two families of drug targets compared to a random set of molecules. The compounds further display reasonable synthesizability and drug-likeness scores.

研究の動機と目的

  • 既知のリガンドをテンプレートとしない新しい分子生成手法の開発、標的特異的設計における制限の克服。
  • 標的タンパク質のアミノ酸配列に条件づけて分子を生成することにより、新規または未解明の標的に対する設計を可能にすること。
  • トレーニングデータと比較して、生成化合物の構造的多様性を向上させつつ、特定のタンパク質スーパーファミリーの既知の結合体に関連性を保つこと。
  • 生成された化合物が合成可能で、望ましい薬物様性の性質を有することを保証すること。
  • G蛋白共役型膜受容体(GPCRs)およびチロシンキナーゼという2つの主要な薬物標的ファミリーにおける手法の有効性を実証すること。

提案手法

  • 手法は、標的タンパク質配列から文脈に応じた埋め込みを生成するため、深層双方向言語モデルであるELMoを用いる。
  • これらのタンパク質配列埋め込みが、LSTMベースの生成モデルの入力として用いられ、新しい分子のSMILES文字列が生成される。
  • 多様性と関連性の最適化のため、拡張エピソード尤度を用いた強化学習が生成器に適用される。
  • モデルは、BindingDBのタンパク質-リガンドペアを用いてトレーニングおよび検証され、GPCRsおよびチロシンキナーゼのそれぞれについて、別々のトレーニングおよびテストセットが使用される。
  • タンパク質配列はELMoで埋め込まれ、その結果得られたベクトルが平均化され、全タンパク質の単一の表現に統合される。
  • 生成器は、タンパク質埋め込みを条件として、有効で多様かつ生物学的に関連性のあるSMILES文字列を生成する尤度を最大化するように訓練される。

実験結果

リサーチクエスチョン

  • RQ1既知のリガンドの事前知識がなくても、タンパク質配列のみに条件づけて新しい分子生成が効果的に可能か?
  • RQ2トレーニングセットとは構造的に異なるが、標的ファミリーの既知の結合体に類似した分子を生成できるか?
  • RQ3生成された化合物が望ましい薬物様性および合成可能性のプロファイルを有するか?
  • RQ4キナーゼアイソフォームのような高い配列類似性を示す標的において、モデルの性能はいかがなものか?
  • RQ5未知または複数の結合部位を有する標的に対しても、この手法は一般化可能か?

主な発見

  • GPCR標的では、Seq2Molが生成した化合物のフラグメント類似度距離は0.847であり、ベースライン(AAE: 0.929、CharRNN: 0.942、VAE: 0.941)よりも顕著に低く、既知の結合体との類似度が高かった。
  • チロシンキナーゼ標的では、フラグメント類似度距離は0.806であり、再びすべてのベースラインより低く、既知のリガンドとの関連性が向上したことを示した。
  • 生成化合物の平均分子量は、GPCRsで471.77 ± 87.95 g/mol、チロシンキナーゼで464.33 ± 86.83 g/molであり、一般的な薬物様性の範囲内にあった。
  • 合成可能性スコアは、GPCRsで2.27 ± 0.49、チロシンキナーゼで2.40 ± 0.55であり、高い合成可能性を示した。
  • QEDスコアは、GPCRsで0.38 ± 0.17、チロシンキナーゼで0.39 ± 0.18であり、中程度の薬物様性を示した。
  • 内部多様性は、GPCRsで0.765、チロシンキナーゼで0.742と、ベースラインモデルを上回り、化学空間の効果的な探索が行われたことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。