Skip to main content
QUICK REVIEW

[论文解读] Named Entity Inclusion in Abstractive Text Summarization

Sergey Berezin, Tatiana Batura|arXiv (Cornell University)|Jul 5, 2023
Topic Modeling被引用 7
一句话总结

本文提出掩码命名实体语言建模(MNELM),一种预训练方法,通过使用微调后的 RoBERTa NER 模型检测命名实体并将其掩码,从而增强生成式摘要模型对特定领域命名实体的关注。该方法在保持竞争性 ROUGE 分数的同时,提升了命名实体包含的精确率(0.93 vs. 0.86)和召回率(0.39 vs. 0.38),优于标准 MLM 预训练。

ABSTRACT

We address the named entity omission - the drawback of many current abstractive text summarizers. We suggest a custom pretraining objective to enhance the model's attention on the named entities in a text. At first, the named entity recognition model RoBERTa is trained to determine named entities in the text. After that, this model is used to mask named entities in the text and the BART model is trained to reconstruct them. Next, the BART model is fine-tuned on the summarization task. Our experiments showed that this pretraining approach improves named entity inclusion precision and recall metrics.

研究动机与目标

  • 解决生成式文本摘要中持续存在的命名实体遗漏问题,特别是在命名实体准确性至关重要的科学文本中。
  • 通过确保生成摘要保留源文本中的关键领域特定命名实体,提升模型生成结果的忠实度。
  • 开发一种预训练策略,使模型在无需外部知识库或基于规则的约束条件下,天然具备对命名实体的敏感性。
  • 通过在预训练期间聚焦模型对命名实体的关注,实现摘要任务中更快的收敛速度和更强的事实一致性。
  • 提供一种无监督、可扩展的替代方案,以替代现有依赖参考摘要或关键词提取进行实体注入的方法。

提出的方法

  • 在 SCIERC 数据集上微调基于 RoBERTa 的命名实体识别(NER)模型,以识别科学文本中的科学实体(如方法、度量、任务等)。
  • 利用训练好的 NER 模型自动识别并掩码 ArXiv 数据集中的命名实体,将其替换为 [mask] 标记。
  • 使用掩码后的科学文本对 BART 模型进行预训练,采用掩码语言建模目标,使模型能够重建原始命名实体。
  • 使用标准序列到序列训练方法,在单个训练周期内对预训练的 BART 模型进行微调,以完成生成式摘要任务。
  • 在 MNELM 预训练期间采用 50% 的掩码概率,以平衡对命名实体的关注与通用语言建模的需要。
  • 在 MNELM 预训练期间,每 10,000 步使用学习率衰减调度器进行学习率衰减;在微调阶段,每 5,000 步进行一次衰减,以防止过拟合。
Figure 1: Training sequence
Figure 1: Training sequence

实验结果

研究问题

  • RQ1一种强调命名实体重建的预训练目标是否能提升生成式摘要中的实体包含率?
  • RQ2与标准 MLM 预训练相比,MNELM 预训练在命名实体精确率与召回率方面表现如何?
  • RQ3MNELM 预训练是否能在保持强 ROUGE 分数的同时,实现摘要任务中的更快收敛?
  • RQ4该方法是否无需依赖外部知识库或参考摘要监督即可有效应用?
  • RQ5以实体为中心的预训练在多大程度上减少了与命名实体相关的幻觉现象?

主要发现

  • 经过 MNELM 预训练的 BART 模型实现了 0.93 的命名实体精确率,显著高于标准 MLM 基线的 0.86。
  • 与标准 MLM 的 0.38 相比,MNELM 将命名实体召回率提升至 0.39,表明对源文本实体的覆盖更全面。
  • 尽管整体 ROUGE 分数略低(如 ROUGE-1 F1:0.36 vs. 0.35),MNELM 模型在训练过程中表现出更快的收敛速度,尤其是在与实体相关的指标上。
  • 在生成过程中,模型对领域特定实体表现出更强的关注,降低了幻觉或遗漏关键术语的可能性。
  • 通过聚焦于重建实际命名实体而非通用词汇,MNELM 方法有效减少了与实体相关的幻觉。
  • 即使 NER 任务的标注数据有限,该方法依然有效,因为它利用微调后的 RoBERTa 模型生成高质量的掩码用于预训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。