[论文解读] Predicting Gene-Disease Associations with Knowledge Graph Embeddings over Multiple Ontologies
本文提出了一种知识图谱嵌入方法,整合了多种生物本体论(如基因本体论、MONDO 和 HPO),以预测基因-疾病关联。通过在统一的多本体知识图谱上采用基于随机游走的节点表示,该方法捕捉了超越层级结构的多样化生物关系,显著优于单一本体论或语义相似性基线方法的预测性能。
Ontology-based approaches for predicting gene-disease associations include the more classical semantic similarity methods and more recently knowledge graph embeddings. While semantic similarity is typically restricted to hierarchical relations within the ontology, knowledge graph embeddings consider their full breadth. However, embeddings are produced over a single graph and complex tasks such as gene-disease association may require additional ontologies. We investigate the impact of employing richer semantic representations that are based on more than one ontology, able to represent both genes and diseases and consider multiple kinds of relations within the ontologies. Our experiments demonstrate the value of employing knowledge graph embeddings based on random-walks and highlight the need for a closer integration of different ontologies.
研究动机与目标
- 通过利用来自多个生物本体论的更丰富的语义表示,提升基因-疾病关联预测的准确性。
- 解决单一本体论方法仅限于建模层级关系的局限性。
- 探究通过知识图谱嵌入整合多样化本体论是否能提升预测性能。
- 评估基于随机游走的嵌入技术在捕捉复杂生物关系方面的有效性。
提出的方法
- 通过整合包括基因本体论(GO)、MONDO 和人类表型本体论(HPO)在内的多个生物本体论,构建统一的知识图谱。
- 在多本体图谱上应用知识图谱嵌入技术——特别是类似 node2vec 的随机游走方法——以学习基因和疾病节点的稠密向量表示。
- 利用学习到的嵌入计算基因与疾病对之间的相似性得分以进行预测。
- 使用已知的基因-疾病关联作为正样本进行模型训练与评估,并通过随机配对生成负样本。
- 与基线方法(包括语义相似性和单一本体论知识图谱嵌入)进行性能比较。
- 采用链接预测框架评估模型恢复已知关联的能力。
实验结果
研究问题
- RQ1与单一本体论方法相比,将多个生物本体论整合到单一知识图谱中,是否能提升基因-疾病关联的预测性能?
- RQ2基于随机游走的知识图谱嵌入方法与传统语义相似性方法相比,在预测基因-疾病关联方面表现如何?
- RQ3除层级关系外,多样化类型的生物关系在多大程度上有助于提升预测性能?
- RQ4与孤立或独立的本体论表示相比,使用统一的多本体知识图谱是否具有可测量的优势?
主要发现
- 多本体知识图谱嵌入方法在预测基因-疾病关联方面显著优于传统的语义相似性方法。
- 基于随机游走的知识图谱嵌入在性能上优于在单一本体论上训练的基线模型。
- 整合多个本体论——尤其是结合分子、表型和疾病相关术语——增强了模型捕捉生物相关关系的能力。
- 该方法的 AUC 分数高于单一本体论基线,表明其在区分正负基因-疾病对方面具有更强的判别能力。
- 结果凸显了跨本体论整合的重要性,因为孤立的本体论无法捕捉生物证据的完整谱系。
- 本研究证实,利用跨本体论多样化关系的知识图谱嵌入比仅限于层级结构的方法更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。