Skip to main content
QUICK REVIEW

[论文解读] MS2: Multi-Document Summarization of Medical Studies

Jay DeYoung, Iz Beltagy|arXiv (Cornell University)|Apr 13, 2021
Topic Modeling参考文献 81被引用 8
一句话总结

MS^2 引入了一个大规模、公开可用的生物医学系统综述数据集,包含20,000篇系统综述和470,000篇相关研究摘要,用于医学领域的多文档摘要任务。本文提出一种基于BART的序列到序列模型,用于文本到文本的摘要生成,并引入一种基于PICO元素的结构化表格到表格任务,其在证据方向上与标准摘要的吻合度达到约50%,标志着向自动化文献综述综合迈出的基础性一步。

ABSTRACT

To assess the effectiveness of any medical intervention, researchers must conduct a time-intensive and highly manual literature review. NLP systems can help to automate or assist in parts of this expensive process. In support of this goal, we release MS^2 (Multi-Document Summarization of Medical Studies), a dataset of over 470k documents and 20k summaries derived from the scientific literature. This dataset facilitates the development of systems that can assess and aggregate contradictory evidence across multiple studies, and is the first large-scale, publicly available multi-document summarization dataset in the biomedical domain. We experiment with a summarization system based on BART, with promising early results. We formulate our summarization inputs and targets in both free text and structured forms and modify a recently proposed metric to assess the quality of our system's generated summaries. Data and models are available at https://github.com/allenai/ms2

研究动机与目标

  • 通过创建一个可扩展、公开可用的数据集,解决生物医学文献综述耗时且依赖人工的流程,以支持多文档摘要任务。
  • 使自然语言处理系统能够整合并总结多篇医学研究中相互矛盾的证据。
  • 支持开发自动化工具,以辅助系统综述的生成,特别是针对范围综述或探索性综述。
  • 引入自由文本和基于PICO的结构化摘要形式,实现对模型输出的细粒度评估。
  • 通过提供建模复杂证据综合与质量评估的资源,推动自然语言处理在生物医学领域的进展。

提出的方法

  • MS^2 数据集从Semantic Scholar语料库中构建,提取系统综述及其引用的研究摘要。
  • 将研究摘要作为输入、综述摘要部分作为目标,构建文本到文本的多文档摘要任务,支持序列到序列建模。
  • 在数据集上微调基于BART的模型,以从多篇研究输入生成摘要。
  • 引入一种基于PICO(人群、干预、对照、结局)元素的结构化表格到表格的建模范式,利用现有的生物医学信息抽取工具提取PICO元素。
  • 采用一种改进的评估指标,通过将生成的摘要与标准结构化摘要进行比较,评估摘要质量。
  • 该数据集支持端到端摘要生成和中间结构化推理,能够评估事实一致性与证据方向。

实验结果

研究问题

  • RQ1序列到序列模型能否有效将多篇医学研究摘要整合为连贯且证据一致的摘要?
  • RQ2模型生成的摘要在多大程度上能与标准综述中陈述的证据方向(如正面、负面、中性)保持一致?
  • RQ3基于PICO的结构化表示在多大程度上能提升多文档医学摘要的可解释性与评估精度?
  • RQ4所提出的数据集能否支持开发出以系统性方式处理研究间矛盾证据的系统?
  • RQ5在生物医学摘要任务中,基于BART的模型在使用自由文本与结构化输入表示时,性能表现有何差异?

主要发现

  • 基于BART的模型生成的摘要流畅,约50%的案例与标准摘要的证据方向一致。
  • 该数据集包含20,000篇系统综述和470,000篇研究摘要,是目前生物医学领域规模最大、公开可用的多文档摘要数据集。
  • 研究发表与综述发表之间的时滞约为8年,凸显了文献综合自动化的重要性。
  • 基于PICO的结构化形式使摘要质量与证据一致性的评估更加细粒度。
  • 该数据集支持文本到文本和表格到表格的摘要任务,支持多样化的评估范式。
  • 所提出的评估指标经调整后适用于结构化输出,能够可靠评估生成摘要的事实一致性和证据对齐程度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。