[论文解读] Newsroom: A Dataset of 1.3 Million Summaries with Diverse Extractive Strategies
本文介绍了 Newsroom 数据集,该数据集包含来自 38 家主要出版物(1998–2017 年)的 130 万条人工撰写的新闻摘要,这些摘要以 HTML 元数据形式收集,用于搜索和社交媒体。本文分析了从抽取式到生成式摘要策略的连续谱,通过 ROUGE 和人工评估展示了该数据集的多样性与挑战性,并表明在 Newsroom 上进行训练可提升模型在域外摘要任务上的性能。
We present NEWSROOM, a summarization dataset of 1.3 million articles and summaries written by authors and editors in newsrooms of 38 major news publications. Extracted from search and social media metadata between 1998 and 2017, these high-quality summaries demonstrate high diversity of summarization styles. In particular, the summaries combine abstractive and extractive strategies, borrowing words and phrases from articles at varying rates. We analyze the extraction strategies used in NEWSROOM summaries against other datasets to quantify the diversity and difficulty of our new data, and train existing methods on the data to evaluate its utility and challenges.
研究动机与目标
- 解决大规模、高质量摘要数据稀缺的问题,以支持自动摘要系统的训练与评估。
- 提供一个多样化的真实世界数据集,反映多个新闻领域和时间周期内实际的新闻编辑室摘要实践。
- 量化并描述专业新闻编辑室摘要中使用的抽取式与生成式策略的连续谱。
- 通过自动(ROUGE)和人工评估指标建立摘要模型的评估基准。
- 通过展示在 Newsroom 上微调最先进模型后在域外数据上性能的提升,证明该数据集的实用性。
提出的方法
- 从 38 家主要新闻媒体中收集 130 万条文章-摘要对,其中摘要由记者和编辑撰写,用于搜索引擎和社交媒体的元数据。
- 定义并计算抽取度量指标,以量化摘要内容中源自原文短语的比例,从而将摘要分类为抽取式、混合式和生成式子集。
- 在 Newsroom 数据集上训练并评估多种基线模型(如 TextRank、Pointer-Generator、Abs-N),使用 ROUGE 分数和人工评估。
- 设计一种人工评估协议,包含四个维度——信息量、相关性、流畅性和连贯性,通过众包工作者评估摘要质量,超越 ROUGE 指标。
- 利用人工评估得分比较模型性能,揭示 ROUGE 与人工判断之间的差异。
- 在 Newsroom 上微调一个最先进混合策略摘要模型,并在域外测试集上评估其性能,以评估迁移学习的效用。
实验结果
研究问题
- RQ1专业新闻编辑室摘要在不同媒体和主题中,其抽取式与生成式策略的使用程度在多大程度上存在差异?
- RQ2Newsroom 中摘要风格的多样性与现有摘要数据集相比,在抽取度、压缩率和覆盖度方面有何不同?
- RQ3在该数据集中,自动评估指标(如 ROUGE)与人工对摘要质量的判断在多大程度上相关?
- RQ4在 Newsroom 上进行训练是否能提升摘要模型在域外测试数据上的性能,如果是,提升幅度如何?
- RQ5不同类型的神经网络模型(如抽取式、生成式、指针-生成模型)在这一多样化、真实世界数据集上的流畅性、连贯性和信息量表现如何?
主要发现
- Newsroom 包含来自 38 家主要新闻媒体的 130 万条文章-摘要对,时间跨度近二十年(1998–2017 年),摘要由专业记者撰写,供公众阅读。
- 该数据集在摘要策略上表现出高度多样性,摘要从高度抽取式到完全生成式不等,其差异通过与原文的短语级重叠程度来衡量。
- 人工评估显示,仅靠 ROUGE 分数不足以评估摘要质量,因为尽管某些模型(如抽取式最优模型)的 ROUGE 分数较高,但人工评分者对其流畅性和连贯性评价较低。
- TextRank 在人工评估中得分最高(4.0 满分 5.0),因其在流畅性和连贯性方面表现优异,尽管其信息量低于部分神经网络模型。
- Pointer-Generator 模型(尤其是 Pointer-S 和 Pointer-N)在信息量和相关性方面得分高于 TextRank,但在流畅性和连贯性方面得分较低。
- 在 Newsroom 上微调一个最先进混合策略模型后,其在域外摘要基准测试中的表现得到提升,证明了该数据集在数据密集型学习中的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。