Skip to main content
QUICK REVIEW

[论文解读] Leveraging Lead Bias for Zero-shot Abstractive News Summarization

Chenguang Zhu, Ziyi Yang|arXiv (Cornell University)|Dec 25, 2019
Topic Modeling参考文献 35被引用 8
一句话总结

本文提出通过在新闻文章中利用首句偏差(lead bias),通过在大规模过滤后的2140万篇新闻文章语料上进行自监督预训练,使摘要生成模型预测文章其余部分的首句,从而实现零样本摘要生成的最先进性能,无需微调即可在DUC2003数据集上将BART的ROUGE-1得分提升13.7%。

ABSTRACT

A typical journalistic convention in news articles is to deliver the most salient information in the beginning, also known as the lead bias. While this phenomenon can be exploited in generating a summary, it has a detrimental effect on teaching a model to discriminate and extract important information in general. We propose that this lead bias can be leveraged in our favor in a simple and effective way to pre-train abstractive news summarization models on large-scale unlabeled news corpora: predicting the leading sentences using the rest of an article. We collect a massive news corpus and conduct data cleaning and filtering via statistical analysis. We then apply self-supervised pre-training on this dataset to existing generation models BART and T5 for domain adaptation. Via extensive experiments on six benchmark datasets, we show that this approach can dramatically improve the summarization quality and achieve state-of-the-art results for zero-shot news summarization without any fine-tuning. For example, in the DUC2003 dataset, the ROUGE-1 score of BART increases 13.7% after the lead-bias pre-training. We deploy the model in Microsoft News and provide public APIs as well as a demo website for multi-lingual news summarization.

研究动机与目标

  • 解决低资源、零样本抽象新闻摘要生成问题,无需昂贵的微调。
  • 通过将首句偏差作为预训练信号而非捷径来缓解其对模型泛化能力的负面影响。
  • 开发一种自监督预训练方法,利用无标注数据将通用语言模型(BART、T5)适配至新闻摘要领域。
  • 实现在无需任务特定适配的情况下,跨多个数据集和语言实现有效的零样本摘要生成。
  • 在生产环境中(Microsoft News)部署一个高质量、多语言的摘要系统,提供公共API和演示网站。

提出的方法

  • 该方法将首句偏差预测建模为一种自监督预训练目标:给定新闻文章的非首句部分,预测其首句作为摘要的代理。
  • 从三年的Bing搜索索引中收集了包含2140万篇新闻文章的大规模新闻语料库。
  • 采用统计阈值进行数据过滤:仅保留首三句话与文章其余部分之间非停用词重叠率≥0.65的文章。
  • 将该预训练目标应用于在过滤后数据上微调BART和T5模型,得到BART-LB和T5-LB模型。
  • 所得到的模型在零样本设置下直接应用于测试数据集,无需任何微调或任务特定适配。
  • 为支持多语言,非英文文章先被翻译为英文,再使用零样本模型生成摘要,最后通过Azure Translator回译为原始语言。

实验结果

研究问题

  • RQ1能否将新闻文章中的首句偏差作为自监督信号,以提升零样本抽象摘要生成性能?
  • RQ2在使用首句预测任务对无标注新闻数据进行预训练后,模型是否能在训练分布之外实现更好的泛化能力?
  • RQ3所提出方法在多个基准数据集上与零样本及无监督基线相比表现如何?
  • RQ4模型是否能在无需微调的情况下,跨不同新闻领域和语言实现泛化?
  • RQ5模型是否避免简单复制首句,而是生成抽象化、重新表述的摘要?

主要发现

  • BART-LB在DUC2003数据集上的ROUGE-1得分相比原始BART模型绝对提升了13.7%,且无需任何微调。
  • 在DUC2004和XSum数据集上,BART-LB的ROUGE-1得分分别提升了8.3%和6.9%,优于原始BART及其他零样本基线模型。
  • 在CNN/DailyMail、XSum和Gigawords数据集上,BART-LB的ROUGE-1得分分别优于PEGASUS的零样本版本7.6%、6.9%和1.8%。
  • 人工评估确认,BART-LB和T5-LB生成的摘要在逻辑连贯性和抽象性方面优于BART和T5,避免了重复或不合逻辑的表达。
  • 错误分析显示,最常见的错误类型是包含不重要细节(50个样本中有17个),其次是无效指代(50个样本中有12个),但事实性错误相对较少(50个样本中有5个)。
  • 该模型对超参数选择具有鲁棒性,且不会简单复制首句,表现为摘要内容被重新表述并具有逻辑顺序。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。