Skip to main content
QUICK REVIEW

[論文レビュー] Mathematical deep learning for pose and binding affinity prediction and ranking in D3R Grand Challenges

Duc Duy Nguyen, Zixuan Cang|arXiv (Cornell University)|Apr 27, 2018
Computational Drug Discovery Methods参考文献 30被引用数 7
ひとこと要約

本論文は、D3Rグランドチャレンジにおいて蛋白質-リガンド結合親和定数を予測・順位付けするための数学的ディープラーニングフレームワークを提示している。このフレームワークは、マルチスケール重み付きカラーレスグラフと要素別持続的ホモロジーを統合し、機械学習モデルと組み合わせている。D3R GC3の26件の公式タスクのうち10件で1位を獲得し、GC2では絶対的自由エネルギー予測で上位にランクされた。これは、創薬応用における強力な予測能力を示している。

ABSTRACT

Advanced mathematics, such as multiscale weighted colored graph and element specific persistent homology, and machine learning including deep neural networks were integrated to construct mathematical deep learning models for pose and binding affinity prediction and ranking in the last two D3R grand challenges in computer-aided drug design and discovery. D3R Grand Challenge 2 (GC2) focused on the pose prediction and binding affinity ranking and free energy prediction for Farnesoid X receptor ligands. Our models obtained the top place in absolute free energy prediction for free energy Set 1 in Stage 2. The latest competition, D3R Grand Challenge 3 (GC3), is considered as the most difficult challenge so far. It has 5 subchallenges involving Cathepsin S and five other kinase targets, namely VEGFR2, JAK2, p38-$α$, TIE2, and ABL1. There is a total of 26 official competitive tasks for GC3. Our predictions were ranked 1st in 10 out of 26 official competitive tasks.

研究の動機と目的

  • コンピューター支援創薬における結合親和定数予測の精度を向上させる数学的ディープラーニングフレームワークの開発。
  • バーチャルスクリーニングにおけるスコアリング関数の限界に対処するため、先進的なトポロジー的およびグラフ理論的記述子を統合する。
  • 高品質な結晶構造が入手できない状況においても、低次元のトポロジカルおよび幾何的表現を活用して予測性能を向上させる。
  • 大規模な創薬チャレンジにおける多様なタンパク質標的およびリガンド集合に対して、モデルの性能を体系的に評価する。
  • 現在のドッキングプロトコルにおける主なボトル neck を同定し、ポーズ予測誤差とスコアリング性能を分離することで、親和定数予測の精度を向上させる。

提案手法

  • マルチスケール重み付きカラーレスグラフ(MWCG)を用いて、複数スケールでタンパク質-リガンド複合体を表現し、原子レベルの相互作用および柔軟性を捉える。
  • 要素別持続的ホモロジー(PH)を適用し、バイオ分子構造の幾何的および接続性特徴をエンコードするトポロジカル不変量を抽出する。
  • 原子半径に基づくフィルトレーションパラメータを用いて、トポロジカル構造の系列を生成し、バイオ分子の形状およびキリューブ形成を体系的に分析可能にする。
  • これらの数学的記述子を、回帰およびランク付けタスクに適した機械学習モデル(ランダムフォレストおよびディープ畳み込みニューラルネットワークなど)に統合する。
  • クロスドッキング、フリーIFD、制約付きIFDなど、複数のドッキングプロトコルを活用し、スコアリングモデルへの入力用に多様なリガンドポーズを生成する。
  • トポロジカルおよびグラフベースの特徴を物理的および経験的記述子と組み合わせることで、多様なタンパク質-リガンド複合体における一般化および予測精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1マルチスケール重み付きカラーレスグラフと要素別持続的ホモロジーは、タンパク質-リガンド結合親和定数予測のための効果的で低次元の記述子として機能するか?
  • RQ2代数的トポロジーとディープラーニングを統合することで、従来のスコアリング関数と比較して、結合親和定数ランク付けおよび自由エネルギー予測の精度がどの程度向上するか?
  • RQ3ポーズ予測誤差は、バーチャルスクリーニングにおける機械学習ベースのスコアリング関数の性能をどの程度制限しているか?
  • RQ4数学的ディープラーニングモデルは、D3R GC3のような大規模な創薬チャレンジにおける多様で困難な標的にて、最先端の性能を達成できるか?
  • RQ5結晶構造が入手できない状況で、どのドッキングプロトコルが、その後続の親和定数予測に最も信頼性のあるポーズを提供するか?

主な発見

  • D3Rグランドチャレンジ3において、26件の公式競技タスクのうち10件で1位を獲得し、カテプシンSおよびABL1のサブチャレンジでも上位にランクされた。
  • カテプシンSサブチャレンジでは、モデル(レシートID uuihe)が、Kd > 10 μMを除く条件下で Kendall’s τ = 0.57、スピアマン相関 = 0.76 の親和定数ランク付けを達成し、活性/非活性分類では MCC = 0.78 を達成した。
  • GC3のセット1における絶対的自由エネルギー予測では、モデル(レシートID vwbp8)が MCC = 1.0 を達成し、最高スコアである完全な予測性能を示した。
  • GC3のセット2では、モデル(レシートID 5g8ed)が RMSE = 1.02 kcal/mol(MSE = 1.04)の最低値を記録し、他のすべての提出物を上回った。
  • D3R GC2では、セット1のステージ2における自由エネルギー予測で、Kendall’s τ = 0.41 を達成し、両ステージで最高のスコアを記録した。
  • ポーズ予測誤差を除外した場合、カテプシンSサブチャレンジにおけるモデルの Kendall’s τ は、0.21 から 0.54 に向上した。これは、現在の親和定数予測においてポーズの正確性が主なボトル neck であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。