[论文解读] BIGPATENT: A Large-Scale Dataset for Abstractive and Coherent Summarization
本文介绍了 BigPatent,这是一个包含130万份美国专利文献的大规模数据集,每份文献均配有由人工撰写的摘要,旨在解决现有基于新闻的摘要数据集的局限性。与较为平直、以抽取式为主的新闻摘要不同,BigPatent 具有更连贯的语篇结构、更均匀分布的关键内容,以及更少的抽取式片段,从而支持在更强全局内容理解与语篇规划能力下的抽象式摘要研究。
Most existing text summarization datasets are compiled from the news domain, where summaries have a flattened discourse structure. In such datasets, summary-worthy content often appears in the beginning of input articles. Moreover, large segments from input articles are present verbatim in their respective summaries. These issues impede the learning and evaluation of systems that can understand an article's global content structure as well as produce abstractive summaries with high compression ratio. In this work, we present a novel dataset, BIGPATENT, consisting of 1.3 million records of U.S. patent documents along with human written abstractive summaries. Compared to existing summarization datasets, BIGPATENT has the following properties: i) summaries contain a richer discourse structure with more recurring entities, ii) salient content is evenly distributed in the input, and iii) lesser and shorter extractive fragments are present in the summaries. Finally, we train and evaluate baselines and popular learning models on BIGPATENT to shed light on new challenges and motivate future directions for summarization research.
研究动机与目标
- 为解决现有文本摘要数据集的局限性,这些数据集主要基于新闻,且表现出语篇结构扁平化、显著性分布不均以及抽取式内容过多的问题。
- 构建一个大规模、高质量的数据集,以支持抽象式摘要模型在更强全局内容建模与语篇意识方面的训练与评估。
- 通过减少对抽取式片段的依赖并提升实体连贯性,引导未来研究构建生成更连贯、更抽象摘要的系统。
- 在 BigPatent 上对现有模型进行基准测试,揭示当前神经网络抽象式模型在处理语篇结构、避免幻觉或重复方面的不足。
提出的方法
- 从 USPTO 数据库中精选130万份美国专利文档及其人工撰写的抽象式摘要。
- 设计数据集以确保关键内容在输入文档中均匀分布,避免集中在前半部分。
- 通过鼓励摘要对内容进行改写与整合,而非逐字复制短语,从而最小化抽取式片段。
- 采用语篇意识的标注方式,以促进摘要中重复出现的实体与复杂句法结构的构建。
- 在 BigPatent 上训练并评估多种抽取式与抽象式模型(如 Lead-3、TextRank、Seq2Seq、Pointer-Generator、SentRewriting),并与 CNN/DM 和 NYT 上的基准表现进行比较。
- 使用 ROUGE 分数及新颖的 n-gram/实体频率分析评估摘要的抽象性质量,并检测幻觉或重复现象。
实验结果
研究问题
- RQ1与标准新闻基准相比,现有抽象式摘要模型在 BigPatent 这类大规模、语篇丰富且非新闻类数据集上的表现如何?
- RQ2当前模型在复杂技术文档的摘要中,多大程度上减少了抽取式片段并保持了语篇连贯性?
- RQ3生成摘要中实体重复模式与人类参考摘要相比如何?这揭示了模型对语篇与显著性的理解程度如何?
- RQ4在关键内容均匀分布且结构复杂的科技文档中,生成抽象式摘要面临哪些主要挑战?
- RQ5基于强化学习的模型(如 SentRewriting)是否在 BigPatent 上优于标准的 seq2seq 模型?这反映了抽象式摘要优化目标的哪些启示?
主要发现
- 所有模型在 BigPatent 上的 ROUGE 分数均低于在 CNN/DM 和 NYT 上的表现,表明 BigPatent 为摘要模型提供了更具挑战性的基准。
- 基于局部特征的抽取式模型(如 TextRank 和 LexRank)在 BigPatent 上的表现优于 RNN-ext RL 模型,表明依赖局部特征的模型在处理更长、更复杂的输入时表现受限。
- 表现最佳的模型 SentRewriting 在 BigPatent 上取得了最高的 ROUGE 分数,证明基于 ROUGE 奖励的强化学习在抽象生成中具有显著优势。
- 神经网络抽象式模型(尤其是 Seq2Seq 和 PointGen)生成的摘要中,实体重复率显著偏高(例如,22.6% 的实体重复超过3次),远高于人工参考摘要(>3次重复的实体占比为4.0%),表明其在语篇层面的规划能力较差。
- 尽管生成的新 n-gram 比例相近(例如,unigram 的比例为18.6%),Seq2Seq 和 PointGen 仍产生了大量虚构或冗余内容,如“上部部分被配置为接收鞋底部分的上部部分”,凸显了幻觉问题的存在。
- PointGen + cov 中的覆盖机制将实体重复率(>3次)降低至1.2%,更接近人类参考水平(4.0%),表明显式正则化有助于缓解重复问题,但无法完全弥补语义理解的差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。