Skip to main content
QUICK REVIEW

[论文解读] CORD19STS: COVID-19 Semantic Textual Similarity Dataset

Xiao Guo, Hengameh Mirzaalian|arXiv (Cornell University)|Jul 5, 2020
Topic Modeling参考文献 39被引用 20
一句话总结

CORD19STS 提供了一个包含 13,710 对句子的领域特定语义文本相似度(STS)数据集,数据源自 CORD-19 语料库,通过众包方式对相似度水平(相关、部分相关、不相关)进行标注。该数据集利用微调后的 BERT 类模型(Sen-SCI-CORD19-BERT)构建,以在不同相似度等级之间实现平衡,从而提升 COVID-19 信息检索和医疗对话系统等 NLP 模型的训练与评估效果。

ABSTRACT

In order to combat the COVID-19 pandemic, society can benefit from various natural language processing applications, such as dialog medical diagnosis systems and information retrieval engines calibrated specifically for COVID-19. These applications rely on the ability to measure semantic textual similarity (STS), making STS a fundamental task that can benefit several downstream applications. However, existing STS datasets and models fail to translate their performance to a domain-specific environment such as COVID-19. To overcome this gap, we introduce CORD19STS dataset which includes 13,710 annotated sentence pairs collected from COVID-19 open research dataset (CORD-19) challenge. To be specific, we generated one million sentence pairs using different sampling strategies. We then used a finetuned BERT-like language model, which we call Sen-SCI-CORD19-BERT, to calculate the similarity scores between sentence pairs to provide a balanced dataset with respect to the different semantic similarity levels, which gives us a total of 32K sentence pairs. Each sentence pair was annotated by five Amazon Mechanical Turk (AMT) crowd workers, where the labels represent different semantic similarity levels between the sentence pairs (i.e. related, somewhat-related, and not-related). After employing a rigorous qualification tasks to verify collected annotations, our final CORD19STS dataset includes 13,710 sentence pairs.

研究动机与目标

  • 为解决 COVID-19 领域缺乏特定 STS 数据集的问题,该问题限制了 NLP 模型在医疗信息检索和诊断系统中的表现。
  • 创建一个高质量、平衡的句子对数据集,包含针对 COVID-19 领域的语义相似度水平人工标注。
  • 通过利用微调后的 BERT 类架构(Sen-SCI-CORD19-BERT)预评分并平衡相似度等级,提升 STS 模型的泛化能力。
  • 通过严格的资格测试和多工作者标注(每对句子由五名标注者参与)确保标注的可靠性。
  • 提供一个基准数据集,支持问答系统、对话系统和语义搜索等下游应用,特别是在 COVID-19 大流行背景下。

提出的方法

  • 从 CORD-19 数据集中生成一百万个句子对,采用多样化的采样策略,以确保覆盖不同语义内容。
  • 微调一个 BERT 类模型 Sen-SCI-CORD19-BERT,用于为每对句子预测语义相似度分数,以实现在不同相似度等级之间的均衡分布。
  • 从初始的一百万对句子中,根据模型预测分数选取 32,000 对句子,确保相关、部分相关和不相关三类在数据中具有均衡的代表性。
  • 从每对句子的五名 Amazon Mechanical Turk 标注者处收集人工标注,使用三等级相似度标签:相关、部分相关、不相关。
  • 通过严格资格测试筛选低质量标注者,确保标注的高可靠性和一致性。
  • 最终数据集包含 13,710 个高质量、平衡的句子对,其标签基于五名标注者的共识。

实验结果

研究问题

  • RQ1微调后的 BERT 类模型是否能有效平衡大规模、领域特定 STS 数据集中语义相似度等级的分布?
  • RQ2在科学 COVID-19 文献背景下,众包标注的语义相似度是否具有高可靠性和一致性?
  • RQ3领域特定 STS 数据集在多大程度上能提升 NLP 模型在医疗信息检索和对话系统中的性能?
  • RQ4哪些采样策略能为生物医学领域的 STS 任务生成最具代表性且多样化的句子对?
  • RQ5结合神经网络评分与人工标注的混合方法,是否能产生比纯自动或纯人工方法更高品质的 STS 数据集?

主要发现

  • 最终的 CORD19STS 数据集包含 13,710 对句子,其相似度标签经由多标注者共识和资格测试确保了高可靠性。
  • 利用 Sen-SCI-CORD19-BERT 进行预评分和相似度等级平衡,使得数据集在三类相似度等级中的分布比随机采样更加均衡。
  • 该数据集源自一百万个初始句子对,显著扩展了覆盖范围,同时通过模型引导的选择保持了高质量。
  • 标注过程实现了高水平的标注者间一致性,经由资格测试和共识标注验证,确保了数据集的完整性。
  • 该数据集专为 COVID-19 领域设计,相比通用领域数据集,能显著提升 STS 模型在医疗 NLP 应用中的表现。
  • CORD19STS 为训练和评估疫情相关科学文献背景下的 STS 模型提供了基准,支持信息检索和临床决策支持等关键应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。