Skip to main content
QUICK REVIEW

[論文レビュー] Development and evaluation of a deep learning model for protein-ligand binding affinity prediction

Marta M. Stepniewska-Dziubinska, Piotr Zielenkiewicz|arXiv (Cornell University)|Dec 19, 2017
Computational Drug Discovery Methods被引用数 10
ひとこと要約

本稿では、タンパク質-リガンド複合体の3次元グリッド表現を処理し、タンパク質およびリガンドの原子を同一に扱うことで、3次元畳み込みニューラルネットワークPafnucyを紹介する。CASBベンチマークにおいて20の最先端スコアリング関数を上回り、入力の摂動に対して頑健であることが示され、類縁解析により重要な相互作用部位が特定された。

ABSTRACT

Structure based ligand discovery is one of the most successful approaches for augmenting the drug discovery process. Currently, there is a notable shift towards machine learning (ML) methodologies to aid such procedures. Deep learning has recently gained considerable attention as it allows the model to "learn" to extract features that are relevant for the task at hand. We have developed a novel deep neural network estimating the binding affinity of ligand-receptor complexes. The complex is represented with a 3D grid, and the model utilizes a 3D convolution to produce a feature map of this representation, treating the atoms of both proteins and ligands in the same manner. Our network was tested on the CASF "scoring power" benchmark and Astex Diverse Set and outperformed classical scoring functions. The model, together with usage instructions and examples, is available as a git repository at http://gitlab.com/cheminfIBB/pafnucy

研究の動機と目的

  • 手動で設計された分子記述子に依存せずに、タンパク質-リガンド結合親和力を予測するディープラーニングモデルの開発。
  • 専門家による特徴工学の依存度を減らし、3次元構造データから直接関連する特徴を学習できるようにする。
  • タンパク質-リガンド複合体内の複雑で非線形な相互作用を捉えることで、バーチャルスクリーニングの正確性を向上させる。
  • 入力の摂動および配置の変化に対するモデル挙動を分析することで、頑健性と解釈可能性を確保する。
  • 完全な学習、予測、データ準備ワークフローを備えた、研究コミュニティ向けに自由に利用可能で拡張可能なツールを提供する。

提案手法

  • モデルは、タンパク質-リガンド複合体の3次元グリッド表現を処理する3次元畳み込みニューラルネットワークを採用し、ボクセル空間に原子の性質を符号化する。
  • タンパク質およびリガンドの原子が入力グリッド内で同一に扱われ、複合体全体にわたる統一的な特徴学習が可能になる。
  • 複数層の3次元畳み込み、非線形活性化関数、プーリングを経て、階層的な空間的特徴が抽出される。
  • モデルの学習には回帰損失関数を用い、ベンチマークデータセットからの実験的結合親和力と予測値の差を最小化する。
  • 入力データは、1.0 Å解像度のグリッド表現を用い、複合体の周囲に5 Åのパディングを追加して事前処理される。
  • 解釈可能性は類縁解析により評価される:グリッドから5 Å立方体領域を除去することで入力を破損させ、予測への影響を測定する。

実験結果

リサーチクエスチョン

  • RQ1専門家が設計した記述子に依存せずに、3次元構造データから直接関連する結合特徴を深層3次元畳み込みネットワークが学習できるか?
  • RQ2標準化されたベンチマークにおいて、このモデルの性能は既存のスコアリング関数と比べてどうか?
  • RQ3タンパク質-リガンド複合体のどの領域が予測された結合親和力に最も顕著に影響を与えるか?
  • RQ4同じ複合体の異なる配置において、モデルは一貫した予測を生成するか?
  • RQ5モデルの内部表現は生物学的に意味のある相互作用を明らかにできるか?

主な発見

  • Pafnucyは、CASBの「スコアリングパワー」ベンチマークにおいて、テストされた20の最先端スコアリング関数すべてを上回り、優れた予測精度を示した。
  • 同一複合体の元の配置と180°回転させた配置の両方で一貫した予測が得られたため、入力変換に対して頑健であることが示された。
  • 類縁解析により、リガンドおよびその直近のタンパク質隣接部位(Gln726, Phe729)が除去された際、予測親和力の低下が最大となった。これは既知の相互作用部位を確認するものであった。
  • 上位15の破壊的削除を考慮した際、Tyr693 や Met713 といった追加のリーダー残基が影響を与えることが判明し、既知の水素結合および疎水性相互作用と整合した。
  • 初期層の活性化は配置によって顕著に異なっていたが、深層に進むにつれて徐々に類似するようになり、ネットワークが不変表現を学習していることが示された。
  • モデルの性能と解釈可能性は、CASBベンチマークを超えて一般化能力を確認するためのAstex Diverse Setでも検証され、さらなる妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。