[论文解读] PRIMER: Pyramid-based Masked Sentence Pre-training for Multi-document Summarization.
PRIMER 是一种基于金字塔结构的掩码句子预训练模型,专为多文档摘要设计,利用 Longformer 架构结合全局注意力机制与一种新颖的实体金字塔策略,以识别文档簇中的关键句子。该模型在零样本、少样本和全监督设置下,在六个多文档摘要数据集上均实现了最先进性能,且仅需极少微调。
Recently proposed pre-trained generation models achieve strong performance on single-document summarization benchmarks. However, most of them are pre-trained with general-purpose objectives and mainly aim to process single document inputs. In this paper, we propose PRIMER, a pre-trained model for multi-document representation with focus on summarization that reduces the need for dataset-specific architectures and large amounts of fine-tuning labeled data. Specifically, we adopt the Longformer architecture with proper input transformation and global attention to fit for multi-document inputs, and we use Gap Sentence Generation objective with a new strategy to select salient sentences for the whole cluster, called Entity Pyramid, to teach the model to select and aggregate information across a cluster of related documents. With extensive experiments on 6 multi-document summarization datasets from 3 different domains on the zero-shot, few-shot, and full-supervised settings, our model, PRIMER, outperforms current state-of-the-art models on most of these settings with large margins. Code and pre-trained models are released at this https URL
研究动机与目标
- 为解决在标注数据有限的情况下,缺乏专为多文档摘要设计的预训练模型的问题。
- 降低对数据集特定架构和大规模微调的依赖。
- 提升在相关文档簇之间的信息选择与聚合能力。
- 开发一种能捕捉多文档中关键内容的预训练目标。
提出的方法
- 采用 Longformer 架构并引入全局注意力机制,以高效处理长序列的多文档输入。
- 应用输入转换,将多文档簇结构化为输入序列。
- 提出间隙句子生成目标,对文档簇中的关键句子进行掩码并重建。
- 采用实体金字塔策略,基于文档间实体的显著性识别并优先选择关键句子。
- 使用掩码句子预训练目标,促使模型重建文档簇中的重要内容。
- 在大规模多文档语料上端到端训练模型,随后在下游摘要任务上进行微调。
实验结果
研究问题
- RQ1具有新颖掩码句子目标的预训练模型是否能提升在多样化领域中的多文档摘要性能?
- RQ2实体金字塔策略在识别文档簇中关键句子方面效果如何?
- RQ3PRIMER 在零样本、少样本和全监督设置下的泛化能力如何?
- RQ4Longformer 中使用全局注意力是否增强了多文档输入的表征学习能力?
- RQ5PRIMER 是否能减少对数据集特定架构和大规模标注微调数据的需求?
主要发现
- PRIMER 在六个多文档摘要数据集上,无论在零样本、少样本还是全监督设置下,均优于现有最先进模型。
- 该模型在低资源的少样本和零样本场景中,相较于先前方法展现出显著的性能优势。
- 实体金字塔策略显著提升了模型识别并聚合文档簇中关键信息的能力。
- Longformer 中的全局注意力机制有效建模了多文档间的长距离依赖关系。
- 间隙句子生成目标有助于提升摘要任务中的句子级表征学习效果。
- 该模型在三个不同领域间表现出良好的泛化能力,展现出强鲁棒性与可迁移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。