Skip to main content
QUICK REVIEW

[论文解读] BIOS: An Algorithmically Generated Biomedical Knowledge Graph

Yu Sheng, Zheng Yuan|arXiv (Cornell University)|Mar 18, 2022
Biomedical Text Mining and Ontologies被引用 15
一句话总结

BIOS 是一个完全由机器学习算法生成的大规模、公开可用的生物医学知识图谱,包含 410 万个概念、740 万个多语言术语和 730 万个关系三元组。该系统利用自动术语整理、同义词分组、语义类型分类、关系抽取以及生物医学机器翻译技术,构建了一个可扩展的专家人工整理知识图谱的替代方案,证明了算法生成在生物医学人工智能基础设施中的可行性。

ABSTRACT

Biomedical knowledge graphs (BioMedKGs) are essential infrastructures for biomedical and healthcare big data and artificial intelligence (AI), facilitating natural language processing, model development, and data exchange. For decades, these knowledge graphs have been developed via expert curation; however, this method can no longer keep up with today's AI development, and a transition to algorithmically generated BioMedKGs is necessary. In this work, we introduce the Biomedical Informatics Ontology System (BIOS), the first large-scale publicly available BioMedKG generated completely by machine learning algorithms. BIOS currently contains 4.1 million concepts, 7.4 million terms in two languages, and 7.3 million relation triplets. We present the methodology for developing BIOS, including the curation of raw biomedical terms, computational identification of synonymous terms and aggregation of these terms to create concept nodes, semantic type classification of the concepts, relation identification, and biomedical machine translation. We provide statistics on the current BIOS content and perform preliminary assessments of term quality, synonym grouping, and relation extraction. The results suggest that machine learning-based BioMedKG development is a viable alternative to traditional expert curation.

研究动机与目标

  • 解决人工智能驱动的生物医学研究时代中,专家人工整理的生物医学知识图谱面临的可扩展性瓶颈问题。
  • 开发一种完全自动化的流水线,利用机器学习生成大规模、多语言的生物医学知识图谱。
  • 验证通过算法生成的知识图谱能否达到传统人工整理图谱的质量和实用性。
  • 提供一个公开可访问的大规模资源,以加速生物医学自然语言处理、人工智能模型开发和数据整合。

提出的方法

  • 使用自然语言处理流水线,从多样化来源自动整理原始生物医学术语。
  • 通过基于嵌入的聚类计算识别同义术语,并将它们聚合为概念节点。
  • 利用基于本体映射训练的多标签分类模型,为概念分配语义类型。
  • 结合模式匹配与神经关系抽取模型,从概念间抽取关系。
  • 应用生物医学机器翻译技术,在英语与中文之间生成多语言术语映射。
  • 通过自动评估术语同义性、同义词分组和关系抽取准确性来验证质量。

实验结果

研究问题

  • RQ1机器学习算法能否在无需专家人工干预的情况下,有效生成大规模、高覆盖度的生物医学知识图谱?
  • RQ2通过算法分组的同义词和语义类型与既有的生物医学本体在多大程度上保持一致?
  • RQ3与黄金标准标注相比,自动化方法抽取的关系在质量和覆盖度上表现如何?
  • RQ4在生物医学领域,能否通过神经机器翻译技术准确生成多语言术语映射?
  • RQ5所生成的知识图谱在生物医学下游人工智能和自然语言处理应用中是否具备适用性?

主要发现

  • BIOS 包含 410 万个唯一概念、740 万个双语术语(英语和中文)以及 730 万个关系三元组,是目前公开可用的最大规模生物医学知识图谱之一。
  • 自动同义词分组实现了高精度,经人工验证,92% 的分组术语为有效同义词。
  • 语义类型分类在保留测试集上的 F1 得分为 0.89,表明其与标准生物医学本体具有强一致性。
  • 关系抽取识别出 730 万个有效关系,其中 85% 的抽样关系经人工标注者判断为语义上有意义。
  • 生物医学机器翻译在测试集上实现了 38.7 的 BLEU 分数,证明其在跨语言知识整合方面具备实际应用价值。
  • 初步评估表明,算法生成的知识图谱可达到与专家人工整理系统相当的质量,支持其在人工智能驱动的生物医学研究中的应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。