Skip to main content
QUICK REVIEW

[论文解读] Covidia: COVID-19 Interdisciplinary Academic Knowledge Graph

Cheng Deng, Jiaxin Ding|arXiv (Cornell University)|Apr 14, 2023
Biomedical Text Mining and OntologiesBiochemistry, Genetics and Molecular Biology被引用 3
一句话总结

Covidia 是一个大规模、跨学科的学术知识图谱,用于新冠研究,整合了生物学、医学、计算机科学、社会学等领域的150万篇论文。它采用对比学习进行多标签论文分类,基于 BERT 的实体与关系抽取,并采用新颖的本体方案实现跨领域知识融合,支持高保真度的跨学科检索,同时在社区发现和链接预测方面建立了基准。

ABSTRACT

The pandemic of COVID-19 has inspired extensive works across different research fields. Existing literature and knowledge platforms on COVID-19 only focus on collecting papers on biology and medicine, neglecting the interdisciplinary efforts, which hurdles knowledge sharing and research collaborations between fields to address the problem. Studying interdisciplinary researches requires effective paper category classification and efficient cross-domain knowledge extraction and integration. In this work, we propose Covidia, COVID-19 interdisciplinary academic knowledge graph to bridge the gap between knowledge of COVID-19 on different domains. We design frameworks based on contrastive learning for disciplinary classification, and propose a new academic knowledge graph scheme for entity extraction, relation classification and ontology management in accordance with interdisciplinary researches. Based on Covidia, we also establish knowledge discovery benchmarks for finding COVID-19 research communities and predicting potential links.

研究动机与目标

  • 为解决跨学科新冠研究的碎片化问题,整合生物学、医学、计算机科学和社会科学等领域的知识。
  • 克服现有文献平台仅聚焦生物医学出版物的局限,这些平台排除了48%的新冠研究论文。
  • 开发一个统一的学术知识图谱,支持多领域实体抽取、关系分类与学科分类。
  • 通过结构化、语义丰富的表示,实现跨学科的有效信息检索与知识发现。
  • 为跨学科研究网络中的社区检测与链接预测建立基准。

提出的方法

  • 提出一种基于对比学习的多标签论文分类模型,为论文分配多个学科标签,提升跨领域分类准确性。
  • 引入一种基于 BERT 的实体抽取模型,并通过维基百科对齐增强,以捕捉学科特定语义,提升开放域适应能力。
  • 采用基于片段嵌入的关系抽取模型,识别跨学科语境下抽取实体之间的关系。
  • 设计一种新颖的学术知识图谱模式,包含双层结构:本体层(概念与关系)和实例层(论文、实体与文献计量数据),通过共享引用链接。
  • 使用 geohash 表示时空信息,并利用 OWL:sameAs 公理将内部实体链接至外部知识库。
  • 基于书目数据构建四个社会科学网络——合作作者网络、引用网络、作者-论文网络与论文-作者网络,用于网络科学分析。

实验结果

研究问题

  • RQ1如何有效对跨多个领域的新冠研究论文进行分类,特别是当它们超出生物学和医学范畴时?
  • RQ2哪些技术能够实现在异质学术领域中准确且上下文感知的实体与关系抽取?
  • RQ3如何在保留学科语义的前提下,将来自不同学科的实体与关系统一整合到知识图谱中?
  • RQ4在新冠背景下,跨学科研究网络的结构与统计特性是什么?
  • RQ5该知识图谱在多大程度上能够支持知识发现任务,如社区检测与链接预测?

主要发现

  • Covidia 整合了150万篇新冠研究论文,其中48%来自非生物医学领域,凸显了跨学科知识平台的必要性。
  • 基于对比学习的分类模型显著提升了跨多样化学科的论文多标签分类准确性,实现了精准的学科标注。
  • 经维基百科对齐增强的 BERT 基础实体抽取模型,在开放域中对领域特定实体的识别实现了高精度。
  • 该知识图谱支持复杂查询,如一跳查询(例如,提及特定知识点的论文)、两跳查询(例如,某一领域中的图示)和三跳查询(例如,某机构研究过的地点),这些是标准搜索引擎无法回答的。
  • 网络分析显示,合作作者、引用与作者-论文网络均呈现幂律度分布,α 值在1.377至1.511之间,表明其具有无标度网络特征。
  • 该系统支持社区检测与链接预测的基准测试,展示了其在识别研究社区与揭示隐藏的跨学科联系方面的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。