Skip to main content
QUICK REVIEW

[論文レビュー] Predicting drug-target interaction using 3D structure-embedded graph representations from graph neural networks

Jaechang Lim, Seongok Ryu|arXiv (Cornell University)|Apr 17, 2019
Computational Drug Discovery Methods参考文献 5被引用数 5
ひとこと要約

本論文では、距離に敏感なグラフアテンションとゲート補強を用いて、タンパク質リガンド複合体の3次元構造情報を直接グラフ表現に組み込むグラフニューラルネットワーク(GNN)モデルを提案する。このモデルは、仮想スクリーニングでAUCROC 0.968、ポーズ予測で0.935を達成し、DUD-Eデータセット上でドッキング法や他のディープラーニング手法を上回る最先端の性能を発揮するとともに、自然界の活性化合物分布を再現する。

ABSTRACT

Accurate prediction of drug-target interaction (DTI) is essential for in silico drug design. For the purpose, we propose a novel approach for predicting DTI using a GNN that directly incorporates the 3D structure of a protein-ligand complex. We also apply a distance-aware graph attention algorithm with gate augmentation to increase the performance of our model. As a result, our model shows better performance than docking and other deep learning methods for both virtual screening and pose prediction. In addition, our model can reproduce the natural population distribution of active molecules and inactive molecules.

研究の動機と目的

  • タンパク質リガンド複合体の3次元構造情報を活用することで、薬物標的相互作用(DTI)予測の精度を向上させること。
  • ドッキング法や既存のディープラーニングモデルが多様な化合物ライブラリにおいて一般化性と性能に欠ける問題を解決すること。
  • 空間的および分子間相互作用を3次元埋め込みグラフ表現を通じて捉えることができるGNNアーキテクチャを開発すること。
  • ベンチマークデータセットを用いて、仮想スクリーニングおよびポーズ予測タスクにおけるモデルの性能を評価すること。
  • モデルが現実世界の化合物集団における活性化合物と非活性化合物の自然な分布をどの程度再現できるかを調査すること。

提案手法

  • 原子座標を用いてタンパク質リガンド複合体のグラフ表現を構築し、原子をノードとし、共有結合・分子間相互作用をエッジとする。
  • 原子間距離を符号化することで、3次元空間的情報を隣接行列に埋め込み、GNNが3次元構造的依存関係を学習できるようにする。
  • 空間的近接性と相互作用タイプに基づいて隣接原子の重要度を重みづける、距離に敏感なグラフアテンション機構にゲート補強を適用する。
  • GNNアーキテクチャはリガンドおよびタンパク質のノードを同時に処理し、複合体の共同表現を学習する。
  • 仮想スクリーニングのためDUD-Eデータセット、ポーズ予測のためPDBbindデータセットでエンドツーエンドに訓練する。
  • モデル性能はAUCROC、調整済みLogAUC、活性分布解析を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1タンパク質リガンド複合体の3次元構造情報を直接組み込むGNNモデルは、従来のドッキング法や他のディープラーニング手法を上回るDTI予測性能を発揮できるか?
  • RQ2距離に敏感なアテンションとゲート補強の統合は、重要な分子間相互作用を捉えるモデルの能力をどのように向上させるか?
  • RQ3ChEMBLおよびMUVデータセットからの実験的に確認された活性化合物と非活性化合物への一般化能力はどの程度か?
  • RQ4モデルは活性化合物と非活性化合物の自然な集団分布を再現できるか?予測活性に人工的なピーク(0.0および1.0付近)を生成しないか?
  • RQ5特に化学的に多様なデータセットにおいて、DUD-Eのトレーニングセットを超えて一般化する際のモデルの限界は何か?

主な発見

  • 仮想スクリーニングのDUD-Eベンチマークにおいて、AUCROC 0.968を達成し、ドッキング法や他のディープラーニング手法を顕著に上回った。
  • PDBbindデータセットにおけるポーズ予測では、AUCROC 0.935を達成し、結合ポーズ評価において優れた性能を示した。
  • 活性化合物と非活性化合物の自然な集団分布を成功裏に再現し、0.0および1.0付近に人工的なピークがほとんどないことを確認した。
  • 実験的に確認された化合物からなるChEMBLデータセットでは、AUCROCが0.633に低下し、DUD-Eに比べ一般化性能が低下していることが示された。
  • 構造的バイアスを最小限に抑えるように設計されたMUVデータセットでは、AUCROCが約0.536にとどまり、ほぼランダム分類性能に近い結果となった。
  • ChEMBLおよびMUVにおける性能低下は、DUD-Eトレーニングセットが化学的空間を十分にカバーしていない可能性を示唆しており、活性化合物のスカフォールドパターンに過剰適合している可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。