Skip to main content
QUICK REVIEW

[論文レビュー] edge2vec: Representation learning using edge semantics for biomedical knowledge discovery

Zheng Gao, Gang Fu|arXiv (Cornell University)|Sep 7, 2018
Bioinformatics and Genomic Networks参考文献 42被引用数 9
ひとこと要約

edge2vec は、期待最大化法を用いて学習されたエッジタイプ遷移行列を介してエッジ意味を明示的にモデル化することで、異種バイオメディカル知識グラフにおけるノード埋め込みを向上させる画期的な表現学習モデルである。確率的勾配降下法で最適化されたこのモデルは、バイオメディカルエンティティ分類、コン pound-遺伝子バイオアクティビティ予測、情報検索の分野で最先端のモデルを顕著に上回る性能を発揮する。これは、多様な生物学的エンティティ間の関係的意味を活用しているからである。

ABSTRACT

Representation learning provides new and powerful graph analytical approaches and tools for the highly valued data science challenge of mining knowledge graphs. Since previous graph analytical methods have mostly focused on homogeneous graphs, an important current challenge is extending this methodology for richly heterogeneous graphs and knowledge domains. The biomedical sciences are such a domain, reflecting the complexity of biology, with entities such as genes, proteins, drugs, diseases, and phenotypes, and relationships such as gene co-expression, biochemical regulation, and biomolecular inhibition or activation. Therefore, the semantics of edges and nodes are critical for representation learning and knowledge discovery in real world biomedical problems. In this paper, we propose the edge2vec model, which represents graphs considering edge semantics. An edge-type transition matrix is trained by an Expectation-Maximization approach, and a stochastic gradient descent model is employed to learn node embedding on a heterogeneous graph via the trained transition matrix. edge2vec is validated on three biomedical domain tasks: biomedical entity classification, compound-gene bioactivity prediction, and biomedical information retrieval. Results show that by considering edge-types into node embedding learning in heterogeneous graphs, extbf{edge2vec}\ significantly outperforms state-of-the-art models on all three tasks. We propose this method for its added value relative to existing graph analytical methodology, and in the real world context of biomedical knowledge discovery applicability.

研究の動機と目的

  • 既存のグラフ表現学習手法が同種グラフに限定されており、異種バイオメディカル知識グラフに内在する豊富な関係的意味を捉えられていないという限界を是正すること。
  • 遺伝子調節や薬剤阻害などのエッジの意味的多様性をノード関係とともにモデル化することで、複雑なバイオメディカル分野における知識発見を向上させること。
  • ノードの内容とそれらを接続する関係の種別を反映する、スケーラブルで効果的なノード埋め込みの学習手法を開発すること。
  • 本モデルの有効性を、合成ベンチマークを越えた複数の実世界のバイオメディカルタスクにおいて検証すること。
  • 分類、予測、検索などの下流タスクを向上させる、バイオメディスインにおける新しいグラフ表現フレームワークを提供すること。

提案手法

  • 本手法は、異種グラフにおける異なるエッジタイプ間の遷移確率をモデル化するため、期待最大化アルゴリズムを用いて学習されたエッジタイプ遷移行列を導入する。
  • 訓練済みのエッジタイプ遷移行列を事前分布として用いて、確率的勾配降下法によりノード埋め込みを学習する。これにより、最適化過程で関係的意味を組み込むことが可能になる。
  • 各エッジタイプを別個の関係として扱うことで、活性化、阻害、共発現などの多様な生物学的相互作用を区別できる。
  • 従来のノード埋め込み手法(例:node2vec)を拡張し、ランダムウォークプロセスにエッジタイプ情報を組み込むことで、ウォーク戦略を関係に依存させる。
  • ノード特徴とエッジ意味を統合的に符号化する密なベクトル表現に、マルチリレーショングラフ表現学習をサポートする。
  • 最終的なノード埋め込みは、分類、予測、検索などの下流タスクの入力として使用され、実バイオメディカルデータセット上で性能が評価される。

実験結果

リサーチクエスチョン

  • RQ1異種グラフにおけるエッジ意味をモデル化することで、バイオメディカル知識発見のためのノード表現学習が向上するか?
  • RQ2エッジタイプ情報を組み込むことで、バイオメディカルエンティティ分類タスクの性能にどのような影響を与えるか?
  • RQ3既存手法と比較して、edge2vec は化合物-遺伝子バイオアクティビティ予測をどの程度改善するか?
  • RQ4エッジの文脈を捉えることで、edge2vec はバイオメディカル情報検索の正確性を向上させるか?
  • RQ5エッジタイプを明示的にモデル化する表現学習モデルは、多様なバイオメディカルタスクに一般化可能か?

主な発見

  • edge2vec は、エッジ意味を活用することで、バイオメディカルエンティティ分類において最先端のモデルを顕著に上回り、高い正確性を達成した。
  • 化合物-遺伝子バイオアクティビティ予測において、edge2vec は優れた性能を示し、関係的文脈が分子相互作用の予測モデリングを改善することを示した。
  • バイオメディカル情報検索において、edge2vec はより高い検索正確性を達成し、エッジに依存する埋め込みが意味的マッチングを向上させることを示した。
  • 本モデルの性能向上は、評価された3つのタスクすべてで一貫しており、異種グラフにおけるエッジタイプモデリングの価値を確認した。
  • EMで学習されたエッジタイプ遷移行列の使用により、より効果的で文脈に適したランダムウォークが可能になり、結果としてより優れたノード表現が得られた。
  • 結果は、エッジ意味が、関係が多様で生物学的に意味のある複雑なバイオメディカルグラフにおける知識発見に不可欠であることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。