Skip to main content
QUICK REVIEW

[論文レビュー] Relation Matters in Sampling: A Scalable Multi-Relational Graph Neural Network for Drug-Drug Interaction Prediction

Arthur Feeney, Rishabh Gupta|arXiv (Cornell University)|May 28, 2021
Advanced Graph Neural Networks参考文献 21被引用数 8
ひとこと要約

本稿では、スケーラブルなマルチリレーショングラフニューラルネットワークであるRS-GCNを提案する。この手法は、薬物同士の相互作用(DDI)予測の精度を向上させるために、関係固有のサンプリング確率を学習する。局所的近傍統計に基づいて、REINFORCEに基づくアプローチを用いて、異なる関係タイプに適応的にサンプリング重みを割り当てることで、非サンプリングベースラインと比較して2.47倍高速な学習と1.92倍高速な推論を達成し、DDIデータにおけるクラス不均衡に対しても効果的に対処する。

ABSTRACT

Sampling is an established technique to scale graph neural networks to large graphs. Current approaches however assume the graphs to be homogeneous in terms of relations and ignore relation types, critically important in biomedical graphs. Multi-relational graphs contain various types of relations that usually come with variable frequency and have different importance for the problem at hand. We propose an approach to modeling the importance of relation types for neighborhood sampling in graph neural networks and show that we can learn the right balance: relation-type probabilities that reflect both frequency and importance. Our experiments on drug-drug interaction prediction show that state-of-the-art graph neural networks profit from relation-dependent sampling in terms of both accuracy and efficiency.

研究の動機と目的

  • 大規模で密なマルチリレーションバイオメディカルグラフ(例:薬物同士の相互作用(DDI)ネットワーク)におけるグラフニューラルネットワーク(GNN)のスケーラビリティの課題に対処すること。
  • 近傍サンプリングにおける単なる頻度を超えて、関係タイプの重要性をモデル化することで、DDIグラフにおけるリンク予測性能を向上させること。
  • 局所的近傍統計に適応する学習可能なサンプリング戦略を開発し、精度と効率の両方を向上させること。
  • 関係固有の確率を学習することで、サンプリングの説明可能性を提供し、頻度とタスク固有の重要性の両方を反映させること。

提案手法

  • 関係依存のサンプリング確率を組み込むことで、関係付きグラフ畳み込みネットワーク(R-GCN)を拡張したRS-GCNを提案する。
  • リンク予測性能を最適化するために、REINFORCEに基づく強化学習アプローチを用いて、関係タイプごとの学習可能なサンプリング確率を導入する。
  • ターゲットエッジの両端のノードの近傍をサンプリングし、局所的近傍のエッジタイプ分布に基づいて関係タイプの確率を更新する。
  • 微分可能サンプリングメカニズムを用い、関係タイプごとに適応的なサンプリングを可能にするエンドツーエンドの学習と推論を実現する。
  • モデルの表現力を維持しながらスケーラビリティを向上させるために、関係固有のメッセージパッシングとサンプリングを組み合わせたGAEベースのアーキテクチャを採用する。
  • グローバルなデータ統計と局所的近傍コンテキストの両方を活用し、重要だがまれな関係タイプに高いサンプリング重みを割り当てる。

実験結果

リサーチクエスチョン

  • RQ1関係固有のサンプリング確率を学習することで、大規模で密なマルチリレーションDDIグラフにおけるGNNの性能と効率を向上させることができるか?
  • RQ2RS-GCNが学習する関係タイプの確率は、逆頻度やランダムサンプリングといった固定戦略と比較して、予測精度と実行時間の点でどのように異なるか?
  • RQ3関係依存のサンプリングは、特にまれな相互作用タイプにおいて、DDI予測におけるクラス不均衡の問題をどの程度効果的に緩和できるか?
  • RQ4学習されたサンプリング確率は、リンク予測において最も情報量が多い関係タイプを特定する解釈可能なインサイトを提供できるか?

主な発見

  • Twosides100データセットにおいて、非サンプリングR-GAEベースラインと比較して、RS-GCNはPR-AUC性能に影響を与えずに2.47倍高速な学習と1.92倍高速な推論を達成した。
  • Twosides100およびDrugbankの両データセットにおいて、予測性能の点で、IFR-GAE や RW-GCN といった最先端のベースラインを上回った。
  • モデルは、関係タイプの頻度とタスク固有の重要性の両方を反映したサンプリング確率を学習し、Twosides100における「外傷性出血」のようなまれだが重要な相互作用に高い重みを割り当てた。
  • Drugbankでは、最も頻度の高いDDIタイプ(「副作用のリスクまたは重症度の増加」)に最も低いサンプリング確率が割り当てられ、最もまれなタイプ(「ハイカリエムリアのリスクまたは重症度の増加」)に最も高い確率が割り当てられた。これは、クラス不均衡の効果的な処理を示している。
  • 学習された確率はグローバルに固定されておらず、局所的近傍構造に適応するため、固定された逆頻度戦略よりも優れた一般化性能を示した。
  • 可視化の結果、同じエッジタイプ頻度を持つ近傍に対しても、RS-GCNはIFR-GAEとは異なる確率を割り当てており、頻度ベースの重み付けを越えたタスクに適応した適応性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。