Skip to main content
QUICK REVIEW

[論文レビュー] A 3D Generative Model for Structure-Based Drug Design

Shitong Luo, Jiaqi Guan|arXiv (Cornell University)|Mar 20, 2022
Computational Drug Discovery Methods参考文献 17被引用数 7
ひとこと要約

本論文は、タンパク質の結合部位の周囲の3次元空間における原子出現確率を推定する3次元生成モデルを提案する。空間的文脈をモデル化するために回転不変性を持つグラフニューラルネットワークを用い、自己回帰的サンプリング方式を採用することで、特定の標的に対して高い結合親和性を示す妥当で多様なドラッグライク分子を生成する。この手法は、リンクヤー設計タスクにおける分子類似度と回復率において、グラフベースのベースラインを上回った。

ABSTRACT

We study a fundamental problem in structure-based drug design -- generating molecules that bind to specific protein binding sites. While we have witnessed the great success of deep generative models in drug design, the existing methods are mostly string-based or graph-based. They are limited by the lack of spatial information and thus unable to be applied to structure-based design tasks. Particularly, such models have no or little knowledge of how molecules interact with their target proteins exactly in 3D space. In this paper, we propose a 3D generative model that generates molecules given a designated 3D protein binding site. Specifically, given a binding site as the 3D context, our model estimates the probability density of atom's occurrences in 3D space -- positions that are more likely to have atoms will be assigned higher probability. To generate 3D molecules, we propose an auto-regressive sampling scheme -- atoms are sampled sequentially from the learned distribution until there is no room for new atoms. Combined with this sampling scheme, our model can generate valid and diverse molecules, which could be applicable to various structure-based molecular design tasks such as molecule sampling and linker design. Experimental results demonstrate that molecules sampled from our model exhibit high binding affinity to specific targets and good drug properties such as drug-likeness even if the model is not explicitly optimized for them.

研究の動機と目的

  • 分子とタンパク質結合部位間の3次元的空間的相互作用を捉えることができない、文字列およびグラフベースの生成モデルの限界を解決すること。
  • 与えられた3次元タンパク質結合部位の文脈において、原子種別および位置の確率分布を学習する3次元生成モデルを開発すること。
  • 3次元構造情報のみを用いて、多様で妥当かつドラッグライクで、特定のタンパク質標的に強く結合する分子を生成可能にすること。
  • タスク固有の微調整なしに、デ・ノボ分子生成やリンクヤー設計などの構造ベースのタスクに応用可能にするための拡張性を向上させること。

提案手法

  • モデルは、回転および並進に不変なニューラルネットワークを用いて、3次元タンパク質結合部位 C を条件として、確率密度 p(e, r|C) を推定する。ここで e は原子種別、r は3次元座標を表す。
  • 3次元文脈エンコーダとして、回転不変性を持つグラフニューラルネットワークを用い、結合部位内の各クエリ座標 r の空間的文脈を符号化する。
  • 自己回帰的サンプリングアルゴリズムにより、生成中の分子に段階的に原子を追加する。各ステップで更新された文脈を用いて、次の原子の配置と種別を条件づける。
  • 追加可能な原子がこれ以上存在しなくなるまでサンプリングを継続し、反復的精錬によって空間的一致性と分子の妥当性を確保する。
  • 後処理や潜在変数モデル(例:VAE や GAN)を必要とせず、学習された3次元分布から直接シンプルでマルチモーダルなサンプリングが可能である。
  • 本手法は、デ・ノボ分子生成およびリンクヤー予測の両タスクで評価され、タスク固有の適合なしに運用可能である。

実験結果

リサーチクエスチョン

  • RQ13次元空間における原子出現確率を推定する3次元生成モデルは、特定のタンパク質結合部位に対して妥当で多様かつ高親和性の分子を生成できるか?
  • RQ2自己回帰的サンプリング方式は、非自己回帰的または後処理ベースの手法と比較して、空間的一致性と化学的妥当性を有する分子を生成する上でどのように優れているか?
  • RQ3本モデルは、これらの特性を明示的に最適化しない状態でも、高いドラッグライクネス(例:QED、SAスコア)を持つ分子をどの程度生成できるか?
  • RQ4再トレーニングやアーキテクチャの変更なしに、リンクヤー設計などの構造ベースの設計タスクに一般化可能か?

主な発見

  • 生成された分子は、基準分子と同等またはそれ以上の高い結合親和性スコアを示し、Vinaスコアから標的タンパク質への強い結合が示された。
  • QED(定量的推定ドラッグライクネス)および SA(合成可能性)スコアが高く、これらの特性を明示的に最適化していないにもかかわらず優れたスコアを達成した。
  • リンクヤー予測において、テスト分子の48.33%を回復し、DeLinkerの40.00%を上回った。平均類似度は0.701(DeLinker:0.612)と高く、優れた性能を示した。
  • 本モデルの中央値Vinaスコアは-8.575 kcal/molであり、DeLinkerと同等の性能を示し、完全に3次元ベースであるにもかかわらず、同等の結合親和性を達成した。
  • 定性的な分析から、生成された分子は基準分子と共通する重要なサブ構造を有しており、結合部位の全体的な構造的類似性を維持していた。
  • 自己回帰的サンプリング方式により、潜在変数の追加的複雑性なしにマルチモーダルな生成が可能であり、分子設計における堅牢性と柔軟性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。