Skip to main content
QUICK REVIEW

[論文レビュー] An efficient graph generative model for navigating ultra-large combinatorial synthesis libraries

Aryan Pedawi, Paweł Gniewek|arXiv (Cornell University)|Oct 19, 2022
Computational Drug Discovery Methods被引用数 8
ひとこと要約

本稿では、明示的な列挙を必要とせず、高速で並列的かつスケーラブルな方法で超大規模な組合せ合成ライブラリ(CSLs)を走査可能な微分可能で階層的なグラフ生成モデル、CSLVAEを提案する。分子をクエリベクトルに符号化することで、階層的キービルダー比較による効率的な検索を可能にし、合成可能性を保証しながら迅速なアナログ検索と化合物生成を実現する。パラメータ数を10分の1に削減し、ベースライン手法と比較して最大1,000倍の高速な推論を達成した。

ABSTRACT

Virtual, make-on-demand chemical libraries have transformed early-stage drug discovery by unlocking vast, synthetically accessible regions of chemical space. Recent years have witnessed rapid growth in these libraries from millions to trillions of compounds, hiding undiscovered, potent hits for a variety of therapeutic targets. However, they are quickly approaching a size beyond that which permits explicit enumeration, presenting new challenges for virtual screening. To overcome these challenges, we propose the Combinatorial Synthesis Library Variational Auto-Encoder (CSLVAE). The proposed generative model represents such libraries as a differentiable, hierarchically-organized database. Given a compound from the library, the molecular encoder constructs a query for retrieval, which is utilized by the molecular decoder to reconstruct the compound by first decoding its chemical reaction and subsequently decoding its reactants. Our design minimizes autoregression in the decoder, facilitating the generation of large, valid molecular graphs. Our method performs fast and parallel batch inference for ultra-large synthesis libraries, enabling a number of important applications in early-stage drug discovery. Compounds proposed by our method are guaranteed to be in the library, and thus synthetically and cost-effectively accessible. Importantly, CSLVAE can encode out-of-library compounds and search for in-library analogues. In experiments, we demonstrate the capabilities of the proposed method in the navigation of massive combinatorial synthesis libraries.

研究の動機と目的

  • 従来のバーチャルハイドロターゲットスクリーニング(vHTS)手法のスケーラビリティを超える、列挙不能な超大規模な組合せ合成ライブラリ(CSLs)を効率的に走査する課題に対処すること。
  • 明示的な列挙に依存せず、巨大で列挙されていないライブラリから化合物を効率的かつランダムアクセス可能な検索を可能にする生成モデルの開発。
  • 計算複雑性とモデルパラメータ数を低減しながらも、分子生成と検索の高忠実度を維持すること。
  • 実用的なドラッグディスcoveryアプリケーションに向け、ライブラリ外の化合物の符号化とライブラリ内アナログ検索を可能にすること。
  • 学習済み分子表現の転移性を、下流の特性予測タスク(例:logPやQED)に対して評価すること。

提案手法

  • CSLVAEは、グラフベースの分子符号化と復元を用いた変分オートエンコーダフレームワークを用い、組合せ合成ライブラリを微分可能で階層的に整理されたデータベースとしてモデル化する。
  • 分子エンコーダは化合物のグラフからクエリベクトルを生成し、そのライブラリの合成経路を表す階層的キーストラクチャを走査するために使用される。
  • デコーダは反応タイプをまず取得し、その後、キーベースの照合を並列で実行することで反応物を復元する。このアプローチにより、自己回帰的生成ステップを最小限に抑える。
  • モデルは、分子表現と検索指示を一致させるために対照的プロキシ訓練目的を用い、効果的な潜在空間学習を可能にする。
  • 階層的キーストラクチャにより、線形列挙と比較して著しく低い計算複雑性の対数時間オーダーの類似度検索が実現される。
  • 本手法はバッチ推論をサポートしており、170MBのメモリ使用量で10万化合物のライブラリを処理可能であり、メモリ使用量を最適化している。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークベースのモデルは、列挙不能でトランジリオン規模の組合せ合成ライブラリに対する効率的でスケーラブルかつ並列化された走査を可能にするか?
  • RQ2最小限の自己回帰的生成を伴うグラフ生成モデルは、合成可能性を保証しながらも高い忠実度の分子再構成を達成できるか?
  • RQ3CSLVAEから学習された潜在空間は、logP や QED といった分子特性予測タスクにおける転移学習をサポートするか?
  • RQ4Arthor や V-SYNTHES といった既存手法と比較して、CSLVAE のアナログ列挙における計算効率とメモリ使用量はどのように異なるか?
  • RQ5CSLVAE はライブラリ外の化合物を符号化し、それらに最も近いライブラリ内アナログを効果的に検索できるか?

主な発見

  • CSLVAEは、Arthorと比較してアナログ列挙において1,000倍の高速化を達成し、トップ100の検索に要するCPU時間は25,968秒からわずか32.46秒に短縮された。
  • 10万化合物のライブラリに対して、CSLVAEはわずか170MBのメモリ使用量で動作し、同等のモデルと比較してパラメータ数を10分の1に削減した。
  • ドメイン内データセット(REAL 100K)では、ECFP4とECFP6のフィンガープintと比較して、logPとQED予測で優れた性能を示し、それぞれRMSEが0.539 ± 0.002および0.072 ± 0.001を達成した。
  • ドメイン外のZINC 250Kデータでは、ECFP6フィンガープintがQED予測でCSLVAEを上回り(RMSE 0.064 ± 0.001 対 0.068 ± 0.001)、学習済み特徴の一般化性能に潜在的な限界があることを示唆した。
  • 階層的デコーディング戦略により、対数時間オーダーの類似度検索が実現され、トランジリオン規模の化合物を含むライブラリに対してもスケーラブルな走査が可能になった。
  • CSLVAEは、ライブラリ外の化合物を符号化し、有効で合成可能かつライブラリ内に存在するアナログを効果的に検索できた。これは、創薬の初期段階における実用的有用性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。