Skip to main content
QUICK REVIEW

[论文解读] A Semantically Enriched Dataset based on Biomedical NER for the COVID19 Open Research Dataset Challenge

Hermann Kroll, Jan Pirklbauer|arXiv (Cornell University)|May 18, 2020
Topic Modeling参考文献 6被引用 7
一句话总结

本文提出了一套语义增强的生物医学命名实体数据集——从 CORD-19 数据集中使用最先进的 NER 工具(TaggerOne 和 GNormPlus)提取的化学物质、疾病、基因和物种。该处理流程针对标题、摘要和全文内容进行处理,生成超过 340 万个全文中的实体提及,以开放的 JSON 文件形式发布,采用 CC BY 4.0 许可,可供 COVID-19 研究工具重复使用。

ABSTRACT

Research into COVID-19 is a big challenge and highly relevant at the moment. New tools are required to assist medical experts in their research with relevant and valuable information. The COVID-19 Open Research Dataset Challenge (CORD-19) is a "call to action" for computer scientists to develop these innovative tools. Many of these applications are empowered by entity information, i. e. knowing which entities are used within a sentence. For this paper, we have developed a pipeline upon the latest Named Entity Recognition tools for Chemicals, Diseases, Genes and Species. We apply our pipeline to the COVID-19 research challenge and share the resulting entity mentions with the community.

研究动机与目标

  • 为应对生物医学 COVID-19 研究中的信息过载挑战,实现以实体为中心的精确信息检索。
  • 开发一种高质量、自动化的处理流程,用于检测和规范化学术文本中的关键生物医学实体——化学物质、疾病、基因和物种。
  • 通过结构化、机器可读的实体注释增强 CORD-19 开放研究数据集,以支持工具开发。
  • 支持构建高级 NLP 应用,如知识图谱构建、摘要生成和生物医学语义搜索。
  • 为研究社区提供可重复使用的、开放的实体提及数据集,附带精确的空间和语义元数据。

提出的方法

  • 该流程利用 TaggerOne 进行化学物质和疾病的识别,使用 GNormPlus 进行基因和物种的识别,均采用其预训练模型实现联合命名实体识别与标准化。
  • 实体检测应用于 CORD-19 数据集(版本 9),处理以 JSON 格式存储的标题、摘要和全文正文段落。
  • 每个实体提及均标注有位置信息(段落索引、起始和结束字符位置)、实体字符串、类型以及来自 MeSH、OMIM、NCBI Gene 或 NCBI 物种分类数据库的标准化 ID。
  • 输出结果以 JSON 字典形式组织,将每个 CORD-19 文档 ID 映射到包含完整元数据的实体提及列表。
  • 该数据集已在 GitHub 上进行版本控制,并计划随 CORD-19 新版本发布而持续更新。
  • 该流程通过依赖在 NCBI Disease、BioCreativeV 和基因标准化测试集等基准语料上经过验证的工具,确保了高质量的注释。

实验结果

研究问题

  • RQ1如何有效将生物医学命名实体识别应用于整个 CORD-19 数据集,以提取结构化的实体提及?
  • RQ2在 CORD-19 语料库的标题、摘要和全文中,关键生物医学实体(化学物质、疾病、基因、物种)的规模和分布如何?
  • RQ3结合 TaggerOne 和 GNormPlus 的统一 NER 流程能否在多种生物医学文本类型中产生高质量且一致的实体注释?
  • RQ4开放的、语义增强的实体注释在多大程度上能提升下游应用(如知识图谱构建或疫情研究中的语义搜索)的性能?
  • RQ5如何在文本结构(标题、摘要、正文段落)中精确标注实体提及的位置,以支持细粒度的信息访问?

主要发现

  • 该流程在 CORD-19 数据集的标题和摘要中检测到约 99,000 个化学物质、145,000 个疾病、59,000 个基因和 165,000 个物种。
  • 在全文文档中,该流程识别出 340 万个化学物质、400 万个疾病、220 万个基因和 470 万个物种。
  • 该数据集以两个开放的 JSON 文件形式发布——一个用于标题和摘要,另一个用于全文——采用知识共享署名 4.0 国际许可。
  • 每个实体提及均包含精确的位置元数据:段落索引、字符级起始和结束位置、实体字符串、类型以及标准化 ID。
  • 作者估计,注释质量与 TaggerOne 和 GNormPlus 的原始基准测试结果相当。
  • 该数据集托管于 GitHub,计划随 CORD-19 数据集新版本的发布而持续更新。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。