Skip to main content
QUICK REVIEW

[论文解读] Relation-weighted Link Prediction for Disease Gene Identification

Srivamshi Pittala, William C. Koehler|arXiv (Cornell University)|Nov 10, 2020
Bioinformatics and Genomic Networks参考文献 20被引用 4
一句话总结

本文提出了一种关系加权链接预测方法,这是一种新颖的图表示学习方法,通过在生物医学知识图谱中为不同关系类型分配可学习权重,提升了疾病基因识别的效果。通过优化这些权重以优先考虑基因-疾病关系,该方法在性能上相比最接近的SOTA方法相对提升了24.1%,并在预测临床试验中帕金森病药物靶点的精确率方面优于Open Targets。

ABSTRACT

Identification of disease genes, which are a set of genes associated with a disease, plays an important role in understanding and curing diseases. In this paper, we present a biomedical knowledge graph designed specifically for this problem, propose a novel machine learning method that identifies disease genes on such graphs by leveraging recent advances in network biology and graph representation learning, study the effects of various relation types on prediction performance, and empirically demonstrate that our algorithms outperform its closest state-of-the-art competitor in disease gene identification by 24.1%. We also show that we achieve higher precision than Open Targets, the leading initiative for target identification, with respect to predicting drug targets in clinical trials for Parkinson's disease.

研究动机与目标

  • 为解决识别与疾病相关基因的挑战,这些基因对于理解并治疗帕金森病等复杂疾病至关重要。
  • 通过考虑关系类型频率的不平衡性,改进异构生物医学知识图谱中的链接预测。
  • 开发一种方法,以提升基因-疾病关系的预测性能,这是现有模型中代表性不足但关键的关系类型。
  • 通过实证评估不同关系类型(如蛋白质-蛋白质相互作用、疾病本体映射和基因-化学物质关联)对预测准确率的影响。
  • 将所提方法与最先进方法及Open Targets(靶点识别领域的领先项目)进行基准对比,尤其关注其在临床试验相关性方面的表现。

提出的方法

  • 构建一个整合多种数据源的生物医学知识图谱,包括基因-疾病关联(DoidGeNET)、蛋白质-蛋白质相互作用(STRING)、来自UniProt的疾病-基因关联(DG_UC)、疾病本体(DO)以及药物-靶点关系(RT)。
  • 应用RotatE模型,该模型将实体和关系嵌入复数向量空间,通过旋转建模头实体与尾实体之间的边。
  • 通过修改RotatE的损失函数,引入关系加权链接预测,以可学习权重 $ w_r $ 缩放每种关系类型的贡献,从而优化基因-疾病链接预测性能。
  • 使用负采样和基于边距的损失进行训练,修改后的损失函数为 $ L' = -\log\sigma(\gamma - w_r \cdot d_r(\mathbf{h}, \mathbf{t})) - \sum_{i=1}^{n} p(h_i', r, t_i') \log\sigma(d_r(\mathbf{h}_i', \mathbf{t}_i') - \gamma) $,以优先考虑低频但关键的关系类型。
  • 在多层图上训练并评估模型,逐步添加关系类型以评估其对性能的贡献。
  • 通过标准指标(如hit@k、平均排名和平均百分位数)进行超参数调优和验证,以确保评估的稳健性。

实验结果

研究问题

  • RQ1生物医学知识图谱中不同关系类型对疾病基因预测性能的贡献如何?
  • RQ2学习关系特定权重是否能提升对代表性不足但生物上关键的关系(如基因-疾病关系)的链接预测性能?
  • RQ3关系加权链接预测是否在识别疾病基因方面优于现有最先进方法?
  • RQ4在预测帕金森病临床试验相关药物靶点方面,该方法与Open Targets相比表现如何?
  • RQ5逐步向知识图谱中增加额外关系层对预测性能有何影响?

主要发现

  • 添加关系层(STRING、DG_UC、DO和RT)逐步提升了性能,完整图谱在hit@30达到0.375,平均排名为1186.81,平均百分位数为93.32。
  • 关系加权RotatE优于原始RotatE,将hit@30从0.368提升至0.375,平均排名降低12.7%,证明了关系特定加权的有效性。
  • 与最接近的SOTA方法DIAMOnD相比,该方法在hit@100上实现了24.1%的相对提升,hit@100达到0.535,而DIAMOnD为0.431。
  • 与Open Targets在预测帕金森病临床试验药物靶点的直接比较中,该模型在前50项预测中表现出更高的精确率,累积命中数更多,且精确率-召回率权衡更优。
  • 与仅含疾病-基因关系的最小图谱相比,完整图谱在平均排名上实现了76.2%的相对降低,在hit@30上实现了98.4%的相对提升,证实了图谱丰富化的价值。
  • 研究证实,关系特定加权显著缓解了对高频关系类型的偏见,提升了对低频但关键的基因-疾病链接的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。