Skip to main content
QUICK REVIEW

[論文レビュー] Relation-weighted Link Prediction for Disease Gene Identification

Srivamshi Pittala, William C. Koehler|arXiv (Cornell University)|Nov 10, 2020
Bioinformatics and Genomic Networks参考文献 20被引用数 4
ひとこと要約

本稿では、生物医学的知識グラフ内の異なる関係タイプに学習可能な重みを割り当てることで、疾患関連遺伝子の同定を向上させる、関係重み付きリンク予測という新しいグラフ表現学習手法を提案する。これらの重みを最適化して遺伝子-疾患関係を優先することで、最も近いSOTA手法よりも相対的に24.1%の性能向上を達成し、臨床試験中のパーキンソン病の薬物標的を予測する際の精度においてOpen Targetsを上回った。

ABSTRACT

Identification of disease genes, which are a set of genes associated with a disease, plays an important role in understanding and curing diseases. In this paper, we present a biomedical knowledge graph designed specifically for this problem, propose a novel machine learning method that identifies disease genes on such graphs by leveraging recent advances in network biology and graph representation learning, study the effects of various relation types on prediction performance, and empirically demonstrate that our algorithms outperform its closest state-of-the-art competitor in disease gene identification by 24.1%. We also show that we achieve higher precision than Open Targets, the leading initiative for target identification, with respect to predicting drug targets in clinical trials for Parkinson's disease.

研究の動機と目的

  • パーキンソン病のような複雑な疾患の理解と治療に不可欠な疾患関連遺伝子を同定するという挑戦に取り組む。
  • 関係タイプの頻度の不均衡を考慮することで、異種の生物医学的知識グラフにおけるリンク予測を改善する。
  • 既存のモデルで不足しがちな関係タイプである遺伝子-疾患関係の予測性能を向上させる手法を開発する。
  • タンパク質-タンパク質相互作用、疾患オントロジーのマッピング、遺伝子-化学物質関連といった異なる関係タイプが予測精度に与える影響を実証的に評価する。
  • 最先端の手法および臨床試験の関連性に特に優れた標的同定イニシアチブとしてのOpen Targetsと比較して、本手法の有効性をベンチマーク化する。

提案手法

  • 遺伝子-疾患関連(DoidGeNET)、タンパク質-タンパク質相互作用(STRING)、UniProtからの疾患-遺伝子関連(DG_UC)、疾患オントロジー(DO)、薬物-標的関係(RT)を含む複数のデータソースを統合した生物医学的知識グラフを構築する。
  • エンティティと関係を複素ベクトル空間に埋め込むRotatEというグラフ表現学習モデルを適用し、エッジをヘッドエンティティとテールエンティティ間の回転としてモデル化する。
  • 各関係タイプの寄与度を学習可能な重み $ w_r $ でスケーリングするようにRotatEの損失関数を変更し、遺伝子-疾患リンク予測の性能最適化を目的とした関係重み付きリンク予測を導入する。
  • 負例サンプリングとマージンベースの損失を用いてモデルを学習し、修正された損失関数 $ L' = -\log\sigma(\gamma - w_r \cdot d_r(\mathbf{h}, \mathbf{t})) - \sum_{i=1}^{n} p(h_i', r, t_i') \log\sigma(d_r(\mathbf{h}_i', \mathbf{t}_i') - \gamma) $ を使用して、頻度が低いが生物学的に重要な関係タイプを優先する。
  • マルチレイヤーのグラフ上でモデルを学習・評価し、関係タイプを段階的に追加することで、各タイプの性能への寄与度を評価する。
  • 標準的な指標(hit@k、平均ランク、平均百分位)を用いてハイパーパramータチューニングと検証を実施し、堅牢な評価を確保する。

実験結果

リサーチクエスチョン

  • RQ1生物医学的知識グラフ内の異なる関係タイプは、疾患関連遺伝子予測の性能にどのように寄与するか?
  • RQ2個々の関係タイプに特化した重みを学習することで、頻度が低くても生物学的に重要な関係(例:遺伝子-疾患)のリンク予測性能を向上させられるか?
  • RQ3関係重み付きリンク予測は、既存の最先端手法を上回る疾患関連遺伝子の同定性能を達成できるか?
  • RQ4パーキンソン病の臨床試験関連薬物標的を予測する際、本手法はOpen Targetsに比べて優れた性能を示すか?
  • RQ5知識グラフに追加の関係レイヤーを段階的に追加することで、予測性能にどのような影響を与えるか?

主な発見

  • STRING、DG_UC、DO、RTの関係レイヤーを段階的に追加することで性能が順次向上し、完全なグラフではhit@30が0.375、平均ランクが1186.81、平均百分位が93.32を達成した。
  • 関係重み付きRotatEは元のRotatEを上回り、hit@30を0.368から0.375に向上させ、平均ランクを12.7%削減した。これにより、関係固有の重み付けの有効性が裏付けられた。
  • 本手法は、最も近いSOTAであるDIAMOnDを24.1%相対的に上回り、hit@100が0.535(DIAMOnDの0.431)を記録した。
  • 臨床試験中のパーキンソン病の薬物標的を予測する際のOpen Targetsとの直接比較において、上位50件の予測でより高い精度を達成し、累積ヒット数が多く、精度-再現率トレードオフも優れていた。
  • 完全なグラフと最小限の疾患-遺伝子関係のみのグラフを比較したところ、平均ランクは76.2%、hit@30は98.4%の相対的増加を示し、グラフの拡充の価値を確認した。
  • 本研究は、関係固有の重み付けが高頻度関係タイプへのバイアスを顕著に緩和し、頻度が低いが重要な遺伝子-疾患リンクの性能向上に寄与することを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。