Skip to main content
QUICK REVIEW

[论文解读] BIOMRC: A Dataset for Biomedical Machine Reading Comprehension

Petros Stavropoulos, Dimitris Pappas|arXiv (Cornell University)|May 13, 2020
Topic Modeling参考文献 30被引用 5
一句话总结

本文介绍了 biomrc,一个基于 PubMed 摘要和标题,利用高精度 PubTator 实体标注构建的大规模、低噪声生物医学机器阅读理解(MRC)数据集。与先前存在噪声的数据集(如 BioRead)不同,biomrc 仅使用结构化的标题和摘要,减少了数据中的干扰因素,显著提升了人类与模型的性能,包括一个基于 BERT 的模型在某些基准测试中超越了专业人类专家的准确率。

ABSTRACT

We introduce BIOMRC, a large-scale cloze-style biomedical MRC dataset. Care was taken to reduce noise, compared to the previous BIOREAD dataset of Pappas et al. (2018). Experiments show that simple heuristics do not perform well on the new dataset, and that two neural MRC models that had been tested on BIOREAD perform much better on BIOMRC, indicating that the new dataset is indeed less noisy or at least that its task is more feasible. Non-expert human performance is also higher on the new dataset compared to BIOREAD, and biomedical experts perform even better. We also introduce a new BERT-based MRC model, the best version of which substantially outperforms all other methods tested, reaching or surpassing the accuracy of biomedical experts in some experiments. We make the new dataset available in three different sizes, also releasing our code, and providing a leaderboard.

研究动机与目标

  • 为解决现有生物医学 MRC 数据集(如 BioRead)存在的高噪声与低可行性问题,这些问题源于全文提取产生的干扰因素以及实体标注不准确。
  • 通过仅使用 PubMed 标题和摘要来提升闭合式生物医学 MRC 的质量与可行性,这些文本结构更清晰,且较少出现跨章节内容或无关内容。
  • 开发一种新型高性能 BERT 基础 MRC 模型,使其在新数据集上的表现超越先前的神经网络模型,并达到或超过生物医学专家的水平。
  • 以三种规模(大、轻量、极小)发布 biomrc 数据集,附带代码与排行榜,以支持生物医学 NLP 领域的可复现研究与模型基准测试。

提出的方法

  • 通过 PubTator 数据库从 2500 万条 PubMed 条目中提取标题与摘要,构建 biomrc 数据集,确保文本来源结构化且可靠。
  • 采用 DNorm 进行生物医学实体标注,其精度高于 MetaMap,从而减少实体误识别与假阳性。
  • 通过在标题中用占位符替换某一生物医学实体,生成闭合式问题,要求模型从摘要中预测出正确的实体。
  • 实施数据过滤以去除过于简单的样本,提升数据集难度,减少简单解法的可能。
  • 开发一种新型基于 BERT 的 MRC 模型,通过实体表示的最大池化聚合(max-aggregation)来增强答案预测能力。
  • 以三种规模(812k、100k 和 60 个测试样本)发布数据集,同时提供代码与公开排行榜,用于模型评估。

实验结果

研究问题

  • RQ1与基于全文的数据集(如 BioRead)相比,仅从 PubMed 标题与摘要构建的生物医学 MRC 数据集是否能显著降低噪声并提升人类表现?
  • RQ2在新的 biomrc 数据集上,简单的启发式方法是否失效,表明数据集干扰减少且任务复杂度提高?
  • RQ3在 biomrc 上训练的基于 BERT 的 MRC 模型是否能达到或超过生物医学专家在相同任务上的表现?
  • RQ4在大规模自动生成的数据集(如 biomrc)上进行预训练,是否能提升在小型、人工标注的生物医学 MRC 基准测试中的性能?

主要发现

  • 人类在 biomrc 上的表现显著优于 BioRead:非专家在 30 个样本的测试集中达到 82% 的准确率,而 BioRead 上仅为 68%,表明噪声减少且任务可行性提高。
  • 生物医学专家在 biomrc 上的 Cohen’s Kappa 一致性达到 70.23–72.30%,证实了标注者之间的一致性高,数据质量可靠。
  • 此前测试过的两种神经网络 MRC 模型在 biomrc 上的表现显著优于在 BioRead 上的表现,表明 biomrc 噪声更少或更适合神经网络学习。
  • 所提出的基于 BERT 的 MRC 模型在所有测试方法中表现最佳,在特定评估设置下达到或超过专家人类的准确率。
  • 高质量的标注与结构化设计使人类在 biomrc 上的表现相比 BioRead 提升了 60%,验证了数据筛选策略的有效性。
  • 通过以三种规模发布 biomrc,同时提供代码与排行榜,实现了可扩展的基准测试与可复现的评估,推动了生物医学 NLP 领域的研究发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。