Skip to main content
QUICK REVIEW

[论文解读] CAiRE-COVID: A Question Answering and Query-focused Multi-Document Summarization System for COVID-19 Scholarly Information Management

Dan Su, Yan Xu|arXiv (Cornell University)|May 4, 2020
Topic Modeling参考文献 43被引用 9
一句话总结

CAiRE-COVID 是一个用于问答和查询聚焦型多文档摘要的系统,利用微调过的预训练语言模型从 CORD-19 学术文献语料库中检索、提取并摘要相关资讯。该系统在 Kaggle 的 COVID-19 挑战任务中胜出,并通过在摘要过程中整合答案相关性,持续提升了 ROUGE 分数,在生成式和抽取式摘要任务中均优于基线模型。

ABSTRACT

We present CAiRE-COVID, a real-time question answering (QA) and multi-document summarization system, which won one of the 10 tasks in the Kaggle COVID-19 Open Research Dataset Challenge, judged by medical experts. Our system aims to tackle the recent challenge of mining the numerous scientific articles being published on COVID-19 by answering high priority questions from the community and summarizing salient question-related information. It combines information extraction with state-of-the-art QA and query-focused multi-document summarization techniques, selecting and highlighting evidence snippets from existing literature given a query. We also propose query-focused abstractive and extractive multi-document summarization methods, to provide more relevant information related to the question. We further conduct quantitative experiments that show consistent improvements on various metrics for each module. We have launched our website CAiRE-COVID for broader use by the medical community, and have open-sourced the code for our system, to bootstrap further study by other researches.

研究动机与目标

  • 为应对从快速增长的 COVID-19 学术文献中高效提取和摘要高优先级科学信息的挑战。
  • 开发一个支持医疗研究人员和公众进行实时、查询聚焦型摘要与答案提取的系统。
  • 通过将问答模块中的答案相关性整合到摘要流程中,提升多文档摘要的相关性和质量。
  • 利用医学专家评估和问答聚焦摘要的基准数据集,对系统性能进行评估与验证。
  • 通过发布公共网站和开源代码库,实现更广泛的访问与再利用。

提出的方法

  • 该系统使用文档检索器,基于查询相关性和覆盖度,从 CORD-19 数据集中筛选相关文档。
  • 片段选择模块采用微调过的问答模型(BioBERT 和 MRQA)的集成方法,识别并突出显示检索段落中的答案片段。
  • 在查询聚焦摘要任务中,系统提出一种新方法,通过基于 BART 的模型将答案相关性同时融入生成式和抽取式摘要。
  • 生成式摘要器采用如 BART(C,A,Q) 的输入配置,将上下文、答案片段和查询拼接,以提升相关性和 ROUGE 分数。
  • 抽取式摘要器利用答案相关性得分对段落进行重排序,再进行摘要,优于 LEAD 基线模型。
  • 系统在 DUC 和 Debatepedia 数据集上进行评估,性能通过 ROUGE 指标和 Kaggle 挑战中的医学专家评估进行衡量。

实验结果

研究问题

  • RQ1神经网络问答系统能否有效从大规模 COVID-19 学术文献语料库中提取精确答案?
  • RQ2如何将答案相关性整合到多文档摘要中,以提升生成摘要的相关性?
  • RQ3在生成式和抽取式查询聚焦摘要中,整合答案相关性是否能带来可测量的 ROUGE 分数提升?
  • RQ4结合问答与摘要的系统是否能在现实世界中的医疗信息检索任务中超越现有基线?
  • RQ5此类系统在未来的疫情或科学信息管理场景中,其泛化能力如何?

主要发现

  • 在 CovidQA 数据集上,问答模块的召回率高于 T5 模型,表明其在答案提取方面表现强劲。
  • 对于基于关键词的问题,问答模型在精确率分数上略胜 T5,表明其在各类问题类型下均具鲁棒性。
  • 所提出的查询聚焦摘要器在 DUC 和 Debatepedia 数据集上,均持续优于基于 BART 的基线模型,显著提升了 ROUGE 分数。
  • 抽取式摘要方法优于 LEAD 基线,显著提升主要归因于基于答案相关性的段落重排序。
  • BART(C,A,Q) 配置(包含上下文、答案片段和查询)在两个数据集上均取得最高 ROUGE 分数,证实了整合答案相关性的有效性。
  • 该系统在 Kaggle CORD-19 挑战的 10 项任务中胜出,经医学专家验证,确认了其在现实场景中的实用性和可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。