Skip to main content
QUICK REVIEW

[論文レビュー] 3D pride without 2D prejudice: Bias-controlled multi-level generative models for structure-based ligand design

Lucian Chan, Rajendra Kumar|arXiv (Cornell University)|Apr 22, 2022
Bioinformatics and Genomic Networks被引用数 4
ひとこと要約

本稿では、1次(化学的モチーフ)およびトポロジカルバイアスを明示的に制御することで、トポロジカルに偏りのない、説明可能でカスタマイズ可能なリガンド生成を可能にする、3Dに意識的な生成的分子設計のための新規なマルチレベル対照的学習フレームワークを提案する。生成的事後分布を化学的要因、トポロジカル要因、構造的文脈要因に因子分解することにより、データ効率性と透明性が向上し、4つのベンチマーク事例において実験的構造活性相関関係が正当化された。

ABSTRACT

Generative models for structure-based molecular design hold significant promise for drug discovery, with the potential to speed up the hit-to-lead development cycle, while improving the quality of drug candidates and reducing costs. Data sparsity and bias are, however, two main roadblocks to the development of 3D-aware models. Here we propose a first-in-kind training protocol based on multi-level contrastive learning for improved bias control and data efficiency. The framework leverages the large data resources available for 2D generative modelling with datasets of ligand-protein complexes. The result are hierarchical generative models that are topologically unbiased, explainable and customizable. We show how, by deconvolving the generative posterior into chemical, topological and structural context factors, we not only avoid common pitfalls in the design and evaluation of generative models, but furthermore gain detailed insight into the generative process itself. This improved transparency significantly aids method development, besides allowing fine-grained control over novelty vs familiarity.

研究の動機と目的

  • 3Dに意識的な生成的モデルにおけるデータスパarsityとバイアス、特に1次サンプリングおよびトポロジカルバイアスを解決すること。
  • 生成的要因を化学的、トポロジカル、3次元的構造的要因に分離することで、モデルの透明性と新規性対熟練度の制御を向上させる階層的生成フレームワークの開発。
  • 段階的かつ因子化されたトレーニングプロトコルによりバイアス要因を分離することで、生成モデルのバイアスなし評価を可能にすること。
  • 大規模な2次元リガンド-タンパク質複合体データセットを活用しながら3次元的構造の正確性を維持することで、データ効率性の向上。
  • 創薬発見におけるヒットからリードへの最適化において、カスタマイズ可能で説明可能かつトポロジカルに偏りのない手法の提供。

提案手法

  • フレームワークは段階的かつマルチステージの対照的学習パイプラインを採用:まず分子ライブラリの確率的分解を用いて1次擬似生成モデル $G_p$ を訓練し、次に $G_p$ をベースラインとして2次元モデル $G_{pq}$ を対照的学習で訓練し、その後PDBリガンドで再キャリブレーションして $G'_{pq}$ を得、最後に $G'_{pq}$ をベースラインとして3次元モデル $G_{pqr}$ を訓練。
  • モデルは生成的事後分布を3つの成分に因子分解する:1次モチーフ尤度 $p$、2次元トポロジカル文脈 $q$、3次元的構造的文脈 $r$ で、$r$ はシグモイド活性化付きドット積で計算される:$\alpha_3 = \mathrm{Sigmoid}\left(\frac{\mathbf{v}_{i,3} \cdot \mathbf{u}_{a,3}}{\sqrt{d}}\right)$。
  • 上位レベルのモデル(2次元および3次元)を下位レベルのベースライン($G_p$、$G'_{pq}$)に対して訓練することでバイアス制御を達成し、高頻度のモチーフやトポロジーや生成プロセスに優位性を持たせない。
  • 事後分布の各条件付け段階(2次元 → 3次元 → 1次元)におけるエントロピー変化を追跡することで、モデルの透明性と解釈可能性を向上させ、正規化シャノンエントロピー $\hat{H}$ で定量化。
  • 生成的要因ごとの寄与度を分離・分析することで、最終的な事後分布における新規性と化学的多様性に対する細分化された制御を可能にする。
  • テンプレートベースのドッキングとPDBの類似事例スキャンを用いて、3次元生成モチーフの妥当性と結合サイトへの構造的適合性を検証。

実験結果

リサーチクエスチョン

  • RQ13Dに意識的な生成的モデルにおいて、1次およびトポロジカルバイアスはどのように効果的に制御可能か?
  • RQ2階層的かつ対照的学習フレームワークは、分子生成におけるデータ効率性とモデルの透明性をどの程度向上させるか?
  • RQ3生成的事後分布を化学的、トポロジカル、3次元的構造的要因に因子分解することで、新規性と熟練度の解釈可能性と制御性が向上するか?
  • RQ43次元的構造的文脈の組み込みは、2次元ベースラインと比較して、化学的および立体的妥当性のあるリガンド生成能力にどのように影響するか?
  • RQ5本モデルは実世界の創薬開発状況において、既知の構造活性相関関係(SAR)を回復できるか。その妥当性はどのように検証されるか?

主な発見

  • マルチレベル対照的トレーニングプロトコルは、1次サンプリングバイアスおよびトポロジカルバイアスを効果的に軽減し、トポロジカルに偏りのない、説明可能な生成モデルを実現した。
  • エントロピー解析により、1次および2次元要因($p$ および $q$)が事後分布エントロピーの低減に最も寄与していることが示され、共通で合成可能であるモチーフへの強いガイドラインが示された。
  • 3次元文脈要因($r$)も顕著な寄与を示したが、$p$ および $q$ よりも寄与度が低いことから、3次元モデリングは2次元および1次元要因に比べてまだ最適化が不十分であると示唆された。
  • 4つのベンチマーク事例において、3例中3例で実験的SARが回復され、上位ランクの提案は既知の薬効フォーカスと整合的であり、PDBの類似事例とも一致した。
  • PDB類似事例スキャンにより、成長ベクトル付近に窒素含有ヘテロサイクル(例:ピラゾール、トリアゾール)を導入することが構造的に支持された。
  • テンプレートベースのドッキングにより、カルビンモチーフ(例:CC≡C)が適切な結合モード適合性を有する3次元環境に効果的に統合可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。