[論文レビュー] Leveraging binding-site structure for drug discovery with point-cloud methods
本稿では、タンパク質の結合サイトの3次元構造を活用して、潜在化学空間におけるリガンドの好みを予測する点群ベースの深層学習モデル、TarLigを紹介する。データアライメントおよび増強技術を適用することで、標準の3次元畳み込みニューラルネットワーク(3D-CNN)を上回る性能を達成し、潜在空間の次元数における分散を平均2倍まで低減することで、リガンドの生成やバーチャルスクリーニングの効果的かつ的確な誘導が可能になる。
Computational drug discovery strategies can be broadly placed in two categories: ligand-based methods which identify novel molecules by similarity with known ligands, and structure-based methods which predict molecules with high-affinity to a given 3D structure (e.g. a protein). However, ligand-based methods do not leverage information about the binding site, and structure-based approaches rely on the knowledge of a finite set of ligands binding the target. In this work, we introduce TarLig, a novel approach that aims to bridge the gap between ligand and structure-based approaches. We use the 3D structure of the binding site as input to a model which predicts the ligand preferences of the binding site. The resulting predictions could then offer promising seeds and constraints in the chemical space search, based on the binding site structure. TarLig outperforms standard models by introducing a data-alignment and augmentation technique. The recent popularity of Volumetric 3DCNN pipelines in structural bioinformatics suggests that this extra step could help a wide range of methods to improve their results with minimal modifications.
研究の動機と目的
- リガンドベースと構造ベースのドラッグディスカバリーのギャップを埋めるために、リガンド空間の予測に結合サイトの幾何的構造を統合すること。
- リガンドベース手法が結合サイト情報を無視するという限界と、構造ベース手法が既知のリガンドに依存するという点を是正すること。
- 既知のリガンドの情報が一切不要な状態で、結合サイトの3次元構造のみを用いて、新規の高親和性リガンドの探索を支援するモデルの開発。
- 顕著なサブ領域を潜在リガンド空間で特定することで、化学空間探索の効率性と網羅性を向上させること。
- 3D-CNNの性能を向上させるシンプルでありながら効果的なデータアライメントおよび増強戦略の導入。
提案手法
- 結合サイトを点群として表現し、回転不変性を持つ学習をデータアライメントおよび増強によって実現する3次元畳み込みニューラルネットワーク(3D-CNN)を用いる。
- モデルに供給する前に、結合サイトの点群を回転および平行移動でアライメントすることで標準化し、特徴の学習を向上させる。
- 7層の畳み込み層および2層の全結合層を備えた深層学習モデルを訓練し、結合サイト構造に基づいてリガンドの潜在埋め込みを予測する。
- 共結晶化複合体から得られる結合サイトの意味的表現を学ぶために、自己教師付きの対照的学習目的を用いる。
- 学習された潜在空間を活用して、活性リガンドが豊富に含まれる領域を同定し、ターゲットを絞ったバーチャルスクリーニングを可能にする。
- DUDEデータベースを用いてモデルを評価し、予測との相対的な活性化合物とデコイのエンリッチメント要因および距離順位付けを測定する。
実験結果
リサーチクエスチョン
- RQ13次元結合サイト点群を学習対象とした深層学習モデルは、活性化合物が豊富に含まれるリガンド空間の有意義なサブ領域を予測できるか?
- RQ2データアライメントおよび増強処理は、標準のボリュームメッシュCNNと比較して、結合サイト表現学習における3D-CNNの一般化性能を向上させるか?
- RQ3既知の活性リガンドの知識が一切ない状態で、結合サイト構造のみで新規リガンドの探索をどれほど効果的に誘導できるか?
- RQ4潜在空間における分散低減は、ランダムサンプリングと比較してどの程度顕著か?これは化学空間カバレッジにどのような意味を持つのか?
- RQ5モデルの予測結果を用いて、既知の活性化合物に近い化合物をデコイよりも高い順位にランク付けできるか?
主な発見
- TarLigは、ランダムサンプリングと比較して、潜在空間の次元あたり平均で2倍の分散低減を達成し、高親和性リガンド領域のカバレッジが著しく向上した。
- 既知の活性リガンドとの予測距離の平均二乗誤差(MSE)は0.13であり、ランダムベースラインの0.2より低い値を示しており、活性領域の的確な局所化が可能であることを示している。
- DUDEデータベースの大多数のターゲットにおいて、測定可能なエンリッチメント要因が得られ、予測された領域がデコイよりも活性化合物に近いことを示している。
- データアライメントおよび増強処理により、標準の3D-CNNおよび3DスティーラブルCNNよりも優れた性能を達成しており、3次元形状表現に有効であることが示唆された。
- 結合サイト構造からの1回の予測で十分であり、計算コストの高いドッキングや反復的スクリーニングに代わるスケーラブルな代替手法を提供する。
- 潜在空間埋め込みは、リガンド生成や最適化などの下流タスクをサポートするのに十分に構造的であり、大規模構造データを用いた自己教師付き事前学習の可能性を秘めている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。