Skip to main content
QUICK REVIEW

[論文レビュー] Tri-graph Information Propagation for Polypharmacy Side Effect Prediction

Hao Xu, Shengqi Sang|arXiv (Cornell University)|Jan 28, 2020
Computational Drug Discovery Methods参考文献 15被引用数 11
ひとこと要約

本稿では、タンパク質-タンパク質グラフ上で逐次的にタンパク質埋め込みを学習し、タンパク質-薬物グラフを介してそれらを薬物に伝播させ、薬物-薬物相互作用グラフ上で薬物表現を精獰する、新規なグラフニューラルネットワークモデルであるTri-graph Information Propagation (TIP)を提案する。TIPは、Decagonなどの最先端モデルに比べてAUPRCが7.2%向上し、トレーニング時間は83倍短縮、メモリ使用量は3倍削減する。

ABSTRACT

The use of drug combinations often leads to polypharmacy side effects (POSE). A recent method formulates POSE prediction as a link prediction problem on a graph of drugs and proteins, and solves it with Graph Convolutional Networks (GCNs). However, due to the complex relationships in POSE, this method has high computational cost and memory demand. This paper proposes a flexible Tri-graph Information Propagation (TIP) model that operates on three subgraphs to learn representations progressively by propagation from protein-protein graph to drug-drug graph via protein-drug graph. Experiments show that TIP improves accuracy by 7%+, time efficiency by 83$ imes$, and space efficiency by 3$ imes$.

研究の動機と目的

  • 特にDecagonのフルグラフ学習アプローチに起因する、既存のGCNベースのモデルにおける多薬物副作用(POSE)予測の高い計算コストとメモリ使用量を低減すること。
  • 薬物-薬物相互作用予測に焦点を当てつつ、薬理学的およびタンパク質-タンパク質相互作用データを補助信号として活用することで、予測精度を向上させること。
  • タンパク質と薬物表現学習を別々の段階的サブグラフモジュールに分離することで、効率性を高めること。
  • タンパク質-タンパク質(P-P)、タンパク質-薬物(P-D)、薬物-薬物(D-D)の3つの異なるサブグラフ間で階層的な情報伝播を実現し、マルチモーダルバイオメディカルグラフの柔軟なモデリングを可能にすること。
  • タンパク質から薬物への焦点的で段階的な情報伝播が、統合的でエンドツーエンドのグラフ学習に比べ、優れた性能と効率性を発揮することを示すこと。

提案手法

  • マルチモーダルバイオメディカルグラフから3つのサブグラフを構築する:タンパク質-タンパク質(P-P)グラフ、タンパク質-薬物(P-D)グラフ、および副作用ラベルを有する薬物-薬物(D-D)相互作用グラフ。
  • P-Pグラフ上で、ReLU活性化関数と隣接ノードの正規化集約を用いたグラフ畳み込みネットワーク(GCN)モジュール(PPM)を適用し、タンパク質ノード埋め込みを学習する。
  • P-Dグラフを介して学習済みタンパク質埋め込みを薬物ノードに伝達するために、ReLU活性化関数と近隣平均化を用いた1層のMPNNを用いたグラフ・ツー・グラフ情報伝播(GGM)モジュールを適用する。
  • 伝播されたタンパク質情報と生の薬物特徴量を、連結(TIP-cat)または要素ごとの和(TIP-sum)により統合し、洗練された薬物表現を形成する。
  • 最終的な薬物埋め込み上で、D-Dグラフ上の副作用発現確率を予測するデコーダー(差分可能特徴ベースまたはニューラルネットワークベース)を学習する。
  • 交差エントロピー損失を用いてエンドツーエンドで最適化し、タンパク質と薬物の埋め込み学習を別々にトレーニングすることで、メモリと計算負荷を低減する。

実験結果

リサーチクエスチョン

  • RQ1統合的グラフ学習に比べ、段階的かつサブグラフ特化型の情報伝播フレームワークは、POSE予測の正確性を向上させることができるか?
  • RQ2タンパク質と薬物の表現学習を分離することで、大規模なPOSE予測における計算コストとメモリ使用量をどの程度低減できるか?
  • RQ3P-Dグラフを通じたタンパク質レベルの薬理学的情報の伝播は、薬物-薬物相互作用予測の精度向上にどの程度効果的か?
  • RQ4P-PからD-Dへの階層的伝播(P-Dを介して)は、フルグラフ上で直接統合的モデリングを行うのと比べて、より優れた性能を発揮するか?
  • RQ5最終デコーダーで薬理学的特徴量を明示的に使用しない場合でも、分子的起源を持つ副作用に一般化できるか?

主な発見

  • TIP-catとTIP-sumは、AUPRCが8.90、AUROCが91.4%、AP@50が89.0%を達成し、Decagonに比べAUPRCで7.2%向上し、AUROCおよびAP@50でも顕著に優れている。
  • TIPは、Decagonと比較してトレーニング時間を98.9%(1エポックあたり約9600秒から約115秒)短縮し、ピークGPUメモリ使用量も66.1%(28GB以上から9.47GB)削減した。
  • TIPは、Decagonに比べて3倍の低いメモリ消費量と83倍の高速なトレーニングを達成しており、正確性を損なわず強力な効率性向上を示している。
  • TIP-sumとTIP-catは同等の性能を示しており、連結と和の両操作がタンパク質由来の情報を薬物表現に効果的に統合できることを示している。
  • PPM-GGM-NNアーキテクチャ(TIP)は、dTIP_PおよびdTIP_Dを上回り、タンパク質および薬物情報の共同モデリングが最適なパフォーマンスを発揮するために不可欠であることを示している。
  • DF(差分可能特徴)デコーダーは、NNデコーダーに比べ11.5%の精度向上と43.9%の時間コスト削減を達成したが、より多くのメモリを要するため、速度とメモリ使用量のトレードオフが顕在化している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。