Skip to main content
QUICK REVIEW

[論文レビュー] PrefixMol: Target- and Chemistry-aware Molecule Design via Prefix Embedding

Zhangyang Gao, Yuqi Hu|arXiv (Cornell University)|Feb 14, 2023
Computational Drug Discovery Methods被引用数 4
ひとこと要約

PrefixMolは、3次元タンパク質パッチを介してターゲット結合親和性と複数の化学的性質(例:QED、LogP、SA、Lipinski)を統合的に制御できる、分子設計のための包括的生成モデルを提案する。これらのプレフィックス埋め込みを注意メカニズムに条件付けすることで、単一条件および複数条件生成の両方において優れた制御性を達成し、先行手法を上回り、注意解析を通じて分子性質間の相関関係を明らかにする。

ABSTRACT

Is there a unified model for generating molecules considering different conditions, such as binding pockets and chemical properties? Although target-aware generative models have made significant advances in drug design, they do not consider chemistry conditions and cannot guarantee the desired chemical properties. Unfortunately, merging the target-aware and chemical-aware models into a unified model to meet customized requirements may lead to the problem of negative transfer. Inspired by the success of multi-task learning in the NLP area, we use prefix embeddings to provide a novel generative model that considers both the targeted pocket's circumstances and a variety of chemical properties. All conditional information is represented as learnable features, which the generative model subsequently employs as a contextual prompt. Experiments show that our model exhibits good controllability in both single and multi-conditional molecular generation. The controllability enables us to outperform previous structure-based drug design methods. More interestingly, we open up the attention mechanism and reveal coupling relationships between conditions, providing guidance for multi-conditional molecule generation.

研究の動機と目的

  • ターゲット特異的結合親和性と望ましい化学的性質の両方を満たす分子を統合的フレームワークで生成する課題に対処すること。
  • 個別のモデルの共同学習に代わり、プレフィックス埋め込みを条件付きプロンプトとして用いることで、マルチタスク学習における悪影響的伝播(negative transfer)を克服すること。
  • タンパク質リガンド結合親和性および主要なドラッグライク性質を含む、複数の制約下での正確で制御可能な分子生成を可能にすること。
  • 注意メカニズムの分析を通じて、分子条件間の隠れた結合関係を解明すること。

提案手法

  • モデルは、自己注意メカニズムのクエリおよびキー行列に埋め込みを組み込むことで、ターゲットおよび化学的条件に基づいて生成を条件づける学習可能プレフィックス埋め込みを採用する。
  • タンパク質パッチ(VINAスコア)、QED、LogP、SA、Lipinskiルール適合性といった各条件は、補助ネットワークを介して個別のプレフィックス埋め込みとして符号化される。
  • プレフィックス埋め込みは文脈的プロンプトとして機能し、注意分布に影響を与え、SMILESシーケンスの自己回帰的生成を導く。
  • 勾配に基づく摂動を用いて注意メカニズムを分析し、部分微分を計算することで、ある条件の変化が他の条件の注意重みに与える影響を特定する。
  • 関係行列 R は、条件間の絶対部分微分を合算することで構築され、性質間の相関関係を可視化する。
  • モデルは、複数の目的を同時に最適化できるように、分子性質ラベルが追加された拡張されたCrossDockedデータセットで学習される。

実験結果

リサーチクエスチョン

  • RQ1包括的深層生成モデルは、分子生成においてターゲット結合親和性と複数の化学的性質を効果的に制御できるか?
  • RQ2多様な制約を統合する際の、多条件分子生成における悪影響的伝播をどのように軽減できるか?
  • RQ3条件付き生成の過程で、異なる分子性質間にどのような潜在的結合関係が存在するか?
  • RQ4注意メカニズムは、多条件生成において、条件間の相関関係をどの程度明らかにできるか?

主な発見

  • PrefixMolは、望ましい結合親和性(VINAスコア)と化学的性質を有する分子を生成する点で、先行する構造ベースのドラッグ設計手法を上回る。
  • 単一条件および複数条件生成の両方において強力な制御性を達成しており、性質の値がユーザー指定のターゲットとよく一致する。
  • QEDとSAを同時に制御する際、Lipinskiスコアが5.0に達し、ドラッグライクネスルールへの最適適合を示している。
  • VINA結合親和性は、自身の値よりもQED、LogP、SAの変化に対して最も感受しやすく、これが多条件制御が単一条件最適化を上回る理由を説明している。
  • 注意メカニズムの分析により、LogPとQEDが最も相関の高い性質であり、関係行列で顕著な相互制御性が観察された。
  • 生成された分子の可視化により、基準化合物と比較して構造的新規性が確認され、モデルは単なる修正ではなく、真に新しい高親和性リガンドを生成していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。