Skip to main content
QUICK REVIEW

[論文レビュー] DeepAtom: A Framework for Protein-Ligand Binding Affinity Prediction

Yanjun Li, Mohammad Rezaei|arXiv (Cornell University)|Dec 1, 2019
Computational Drug Discovery Methods参考文献 31被引用数 14
ひとこと要約

DeepAtomは、ボクセル化された3次元構造から原子間相互作用パターンを学習することで、最小限の特徴工学を用いてタンパク質-リガンド結合親和性を予測するデータ駆動型3次元畳み込みニューラルネットワーク(3D-CNN)フレームワークである。本研究では、新しく整備されたベンチマークデータセットを用いて、PDBbind v.2016コアセットで皮積相関係数R = 0.83、RMSE = 1.23 pK単位の最先端性能を達成した。

ABSTRACT

The cornerstone of computational drug design is the calculation of binding affinity between two biological counterparts, especially a chemical compound, i.e., a ligand, and a protein. Predicting the strength of protein-ligand binding with reasonable accuracy is critical for drug discovery. In this paper, we propose a data-driven framework named DeepAtom to accurately predict the protein-ligand binding affinity. With 3D Convolutional Neural Network (3D-CNN) architecture, DeepAtom could automatically extract binding related atomic interaction patterns from the voxelized complex structure. Compared with the other CNN based approaches, our light-weight model design effectively improves the model representational capacity, even with the limited available training data. With validation experiments on the PDBbind v.2016 benchmark and the independent Astex Diverse Set, we demonstrate that the less feature engineering dependent DeepAtom approach consistently outperforms the other state-of-the-art scoring methods. We also compile and propose a new benchmark dataset to further improve the model performances. With the new dataset as training input, DeepAtom achieves Pearson's R=0.83 and RMSE=1.23 pK units on the PDBbind v.2016 core set. The promising results demonstrate that DeepAtom models can be potentially adopted in computational drug development protocols such as molecular docking and virtual screening.

研究の動機と目的

  • 最小限の特徴工学で、エンドツーエンドのデータ駆動型フレームワークとしてタンパく質-リガンド結合親和性予測を実現すること。
  • 既存の結合親和性データセットにおけるラベルノイズの課題に対処するため、体系的に分析・整備された信頼性の高い新規ベンチマークデータセットを構築すること。
  • 微細な原子間相互作用を捉える効率的な3次元畳み込みニューラルネットワーク(3D-CNN)アーキテクチャを用いて、モデルの性能と一般化能力を向上させること。
  • 独立したテストセットにおいて、ディープラーニング、機械学習、従来の手法を含む最先端のスコアリング関数を上回ること。
  • 仮想スクリーニングや分子ドッキングなどの計算ドラッグディスcoveryワークフローへの実用的応用を可能にすること。

提案手法

  • 1.0 Å解像度のボクセル化とPCMax占有度符号化を用いて、タンパク質-リガンド複合体構造を3次元グリッドに変換し、原子寄与を連続的に表現する。
  • ボクセル化された3次元グリッド入力を用いて、自動的に結合関連の原子相互作用パターンを抽出する軽量な3次元畳み込みニューラルネットワーク(3D-CNN)アーキテクチャを採用する。
  • タンパク質およびリガンドの原子を24種類の原子タイプ(ANOLEAおよびArpeggioタイプを含む)と元素タイプで符号化するマルチチャネル表現を用いる。
  • テスト時のデータ拡張として、テスト複合体を複数回回転または変換したバージョンの予測を平均化することで、分散を低減する。
  • ラベルノイズを最小限に抑えて一般化能力を向上させるために、新しく編集された高品質なベンチマークデータセット上でモデルをエンドツーエンドで訓練する。
  • PDBbind v.2016およびAstex Diverse Setを用いたアブレーションスタディにより、グリッド解像度、占有度タイプ、特徴チャネルなどのハイパーパrameterを最適化する。

実験結果

リサーチクエスチョン

  • RQ13次元畳み込みニューラルネットワーク(3D-CNN)ベースのフレームワークは、広範な特徴工学に依存せずに、タンパク質-リガンド結合親和性予測で最先端の性能を達成できるか?
  • RQ2グリッド解像度および占有度符号化戦略の選択が、モデルの性能と計算効率にどのように影響するか?
  • RQ3整備された高品質なベンチマークデータセットを用いることで、モデルの一般化能力と予測精度がどの程度向上するか?
  • RQ4テスト時のデータ拡張は、予測分散を効果的に低減し、予測のロバストネスを向上させることができるか?
  • RQ5独立した検証セットにおいて、DeepAtomは、ディープラーニングおよび従来の手法を含む既存の最先端スコアリング関数をどの程度上回るか?

主な発見

  • DeepAtomは、新たに提案されたベンチマークデータセットで学習させた場合、PDBbind v.2016コアセットで皮積相関係数R = 0.83、RMSE = 1.23 pK単位を達成した。
  • 本モデルは、PDBbind v.2016ベンチマークおよび独立したAstex Diverse Setの両方において、既存の最先端スコアリング関数(ディープラーニング、機械学習、従来手法を含む)を上回った。
  • バイナリーオンリーの占有度ではなくPCMax占有度符号化を用いることで性能が向上し、RMSEは1.360から1.348に低下、Rは0.737から0.741に上昇した。
  • より高いグリッド解像度(0.5 Å)は性能をわずかに向上させるが、計算コストを著しく増加させるため、最適解像度として1.0 Åが選択された。
  • テスト複合体を24通りに回転・変換したバージョンを用いたテスト時のデータ拡張により、予測分散が低減され、さらに性能が向上した。
  • Kd、Ka、Kiの信頼性の高い実験的測定にフィルタリングを施して構築された新規ベンチマークデータセットは、ラベルノイズを低減させることで、モデルの学習と一般化能力を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。