Skip to main content
QUICK REVIEW

[论文解读] Extracting a Knowledge Base of Mechanisms from COVID-19 Papers

Tom Hope, Aida Amini|arXiv (Cornell University)|Oct 8, 2020
Biomedical Text Mining and Ontologies参考文献 56被引用 6
一句话总结

本文提出了一种统一的模式,用于从新冠科学研究文献中提取机制——从生物过程到经济影响的各类机制。作者在包含2,400个实例的标注数据集(Mechanic)上微调了自然语言处理模型,构建了包含150万条机制关系的知识库Comb,其在专家可用性研究中的平均满意度得分为91%,显著优于PubMed的74%。

ABSTRACT

The COVID-19 pandemic has spawned a diverse body of scientific literature that is challenging to navigate, stimulating interest in automated tools to help find useful knowledge. We pursue the construction of a knowledge base (KB) of mechanisms -- a fundamental concept across the sciences encompassing activities, functions and causal relations, ranging from cellular processes to economic impacts. We extract this information from the natural language of scientific papers by developing a broad, unified schema that strikes a balance between relevance and breadth. We annotate a dataset of mechanisms with our schema and train a model to extract mechanism relations from papers. Our experiments demonstrate the utility of our KB in supporting interdisciplinary scientific search over COVID-19 literature, outperforming the prominent PubMed search in a study with clinical experts.

研究动机与目标

  • 为应对快速扩展的、跨学科的新冠科学研究文献的导航挑战。
  • 开发一种统一的模式,以捕捉从分子功能到社会影响等跨科学领域的多样化机制。
  • 从科学论文中构建一个高质量、开放获取的机制关系知识库(Comb)。
  • 展示该知识库在支持结构化、跨学科科学检索方面的实用性。
  • 通过临床专家参与的可用性研究,将系统性能与PubMed进行对比评估。

提出的方法

  • 设计一种粗粒度的机制模式,区分直接机制(如病毒结合)与间接机制(如经济影响)。
  • 使用所提出的模式对2,400个来自新冠论文的机制实例进行标注,构建Mechanic数据集。
  • 在Mechanic数据集上训练最先进的信息抽取模型,以识别自由文本片段中的机制关系。
  • 将训练好的模型应用于CORD-19语料库中的160,000篇摘要,构建Comb知识库,包含150万条机制实例。
  • 在Comb上实现一个搜索引擎,根据用户查询检索结构化的机制关系。
  • 组织一项可用性研究,邀请5名正在治疗和研究新冠的医学博士(MDs)参与,使用标准化问卷将Comb与PubMed进行对比。

实验结果

研究问题

  • RQ1统一的模式是否能有效捕捉病毒学、工程学和经济学等跨学科领域中的多样化科学机制?
  • RQ2在Mechanic数据集上训练的模型,其泛化能力如何?是否能有效应用于新冠以外的生物医学文献?
  • RQ3与传统的PubMed式检索相比,结构化的机制关系知识库是否能提升科学检索的实用性和质量?
  • RQ4临床专家在查找文献中因果和功能关系时,对以机制为中心的检索系统相较于PubMed的偏好程度如何?
  • RQ5Comb中提取的机制关系的准确率和覆盖率如何?与现有开放信息抽取方法相比表现如何?

主要发现

  • Comb知识库包含150万条机制实例,是从160,000篇新冠论文摘要中使用微调后的NLP模型提取的。
  • 对Comb中抽样关系的手动评估显示准确率为88%,表明提取管道具有高度可靠性。
  • 在未进行进一步微调的情况下,基于Mechanic数据集训练的模型在PubMed中抽取的一般生物医学论文样本上达到约80%的准确率,显示出强大的泛化能力。
  • 在5名医学博士参与的可用性研究中,Comb的平均满意度得分为91%,显著高于PubMed的74%(p值 = 4.77×10⁻⁷)。
  • 专家在实用性和结果质量方面均对Comb评分更高,其中4.75/5的专家在包含平局的情况下给予Comb的评分等于或高于PubMed。
  • 针对“新冠与心律失常关联”的查询,PubMed返回的论文标题虽包含两个术语,但未揭示因果机制;而Comb成功检索出明确的机制关系,显示出更高的精确度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。