Skip to main content
QUICK REVIEW

[論文レビュー] Explainable Deep Relational Networks for Predicting Compound-Protein Affinities and Contacts

Mostafa Karimi, Di Wu|arXiv (Cornell University)|Dec 29, 2019
Computational Drug Discovery Methods参考文献 44被引用数 5
ひとこと要約

本論文は、物理的相互作用を明示的にモデル化することで、化合物-タンパク質親和性と原子レベルの接触を同時に予測する、物理学にインspiredされた内在的解釈性を持つ深層関係的ネットワーク、DeepRelationsを提案する。構造的アテンション正則化と監督付き接触信号を用いることで、親和性予測の精度を損なわずに解釈性を大幅に向上させ、接触予測のAUPRCを最大19.3倍に向上させた。

ABSTRACT

Predicting compound-protein affinity is critical for accelerating drug discovery. Recent progress made by machine learning focuses on accuracy but leaves much to be desired for interpretability. Through molecular contacts underlying affinities, our large-scale interpretability assessment finds commonly-used attention mechanisms inadequate. We thus formulate a hierarchical multi-objective learning problem whose predicted contacts form the basis for predicted affinities. We further design a physics-inspired deep relational network, DeepRelations, with intrinsically explainable architecture. Specifically, various atomic-level contacts or "relations" lead to molecular-level affinity prediction. And the embedded attentions are regularized with predicted structural contexts and supervised with partially available training contacts. DeepRelations shows superior interpretability to the state-of-the-art: without compromising affinity prediction, it boosts the AUPRC of contact prediction 9.5, 16.9, 19.3 and 5.7-fold for the test, compound-unique, protein-unique, and both-unique sets, respectively. Our study represents the first dedicated model development and systematic model assessment for interpretable machine learning of compound-protein affinity.

研究の動機と目的

  • 化合物-タンパク質親和性予測のためのディープラーニングモデルにおける解釈性の欠如という重要なギャップを埋めること。これは、合理的なドラッグディスcoveryにとって不可欠である。
  • 標準的なアテンション機構が、親和性の背後にある生物学的に意味のある原子レベルの接触を回復できないことの特定。
  • 水素結合や疎水性相互作用などの原子レベルの相互作用(例:水素結合、ファンデルワールス力)を明示的かつ物理学的根拠に基づいた関係としてモデル化する、新しいディープ関係的アーキテクチャの開発。
  • 関連するタンパク質表面、アミノ酸残基、および残基-原子ペアに段階的に注目を向ける、階層的で多目的な学習フレームワークの導入。
  • 真の接触アノテーションを用いた体系的評価を通し、分布外の化合物やタンパク質に対しても頑健であることを示す。

提案手法

  • タンパク質表面および二次構造から、残基-原子接触ペアに至るまで、段階的に細分化された粒度の高いレベルで化合物-タンパク質相互作用をモデル化する階層的で多段階のアーキテクチャの設計。
  • 表面露出度や残基接触マップなどの予測された構造的文脈によって正則化された、複数の種類の原子レベルの関係(例:水素結合、ファンデルワールス力)に対する残基-原子ペア上の共同アテンションを埋め込む。
  • 部分的に利用可能な真の接触アノテーションを弱い監督として組み込み、アテンション学習を実際の分子相互作用に整合させる。
  • 化合物構造とタンパク質配列を、原子レベルおよび残基レベルの表現を介してメッセージパッシングを用いてGNN(グラフニューラルネットワーク)で符号化。
  • 親和性予測と接触予測を統合したマルチ目的損失関数を用いて、エンドツーエンドでモデルを訓練し、両タスクの共同最適化を実現。
  • 3D構造が入手できない場合の構造的事前知識として、最先端のタンパク質構造予測モデル(例:二次構造および接触マップ予測)を活用。

実験結果

リサーチクエスチョン

  • RQ1アテンション機構のみで、化合物-タンパク質親和性の背後にある生物学的に意味のある原子レベルの接触を信頼性高く回復できるか?
  • RQ2既知の分子相互作用を用いて、化合物-タンパク質親和性予測における解釈性を体系的に定義・評価できるか?
  • RQ3物理学的根拠に基づいた関係的インダクティブバイアスは、ドラッグディスカバリにおけるディープラーニングモデルの解釈性をどの程度向上させ得るか?
  • RQ4親和性と接触予測を同時に学習するモデルは、予測精度を損なわずに優れた解釈性を達成できるか?
  • RQ5提案されたモデルの解釈性は、トレーニング時に見られなかった化合物やタンパク質に対しても一般化可能か?

主な発見

  • DeepRelationsは接触予測の解釈性を顕著に向上させ、最良のベースライン(HRNN-GCN + 共通アテンション)と比較して、デフォルトテストセットでAUPRCが9.48倍向上した。
  • タンパク質固有のテストセットでは、AUPRCが最大19.28倍向上し、未観測のタンパク質に対しても強い一般化性能を示した。
  • トップ50の予測接触のうち、異なるテストセットで33%~39%が真の接触から10Å以内に位置しており、予測された相互作用の空間的正確性が非常に高いことを示した。
  • アブレーションスタディの結果、性能向上の主な要因は、明示的な物理的関係を有する関係的アーキテクチャそのものであり、単にアテンション正則化や監督信号によるものではないことが確認された。
  • 分布外の化合物およびタンパク質に対しても、モデルは高い性能を維持しており、特に化合物固有およびタンパク質固有の設定では、解釈性の向上が顕著に見られた。
  • 事例スタディでは、DeepRelationsがより生物学的に妥当でパターンの明確な接触マップを予測しており、多くの「誤り」予測が真の接触から合理的な空間的距離(≤10Å)内に位置していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。