[论文解读] PSP: Pre-trained Soft Prompts for Few-Shot Abstractive Summarization
本文提出PSP(预训练软提示),一种用于少样本抽象摘要的轻量级微调方法,该方法在编码器和解码器输入中均使用连续软提示,并在源文本内部插入内提示以增强文档理解。仅微调模型参数的0.1%时,PSP在性能上超越全模型微调,并显著优于提示调优(Prompt Tuning),同时在使用3%参数的情况下性能与前缀调优(Prefix-Tuning)相当,展现出在低资源摘要设置下的强大有效性与高效性。
Few-shot abstractive summarization has become a challenging task in natural language generation. To support it, we designed a novel soft prompts architecture coupled with a prompt pre-training plus fine-tuning paradigm that is effective and tunes only extremely light parameters. The soft prompts include continuous input embeddings across an encoder and a decoder to fit the structure of the generation models. Importantly, a novel inner-prompt placed in the text is introduced to capture document-level information. The aim is to devote attention to understanding the document that better prompts the model to generate document-related content. The first step in the summarization procedure is to conduct prompt pre-training with self-supervised pseudo-data. This teaches the model basic summarizing capabilities. The model is then fine-tuned with few-shot examples. Experimental results on the CNN/DailyMail and XSum datasets show that our method, with only 0.1% of the parameters, outperforms full-model tuning where all model parameters are tuned. It also surpasses Prompt Tuning by a large margin and delivers competitive results against Prefix-Tuning with 3% of the parameters.
研究动机与目标
- 解决少样本抽象摘要中的挑战,即标注数据稀缺,且全模型微调易导致过拟合与高计算成本。
- 通过设计更有效的软提示架构,克服标准提示调优在抽象摘要任务中表现不佳的问题。
- 通过在输入文本中结构化插入内提示,提升文档级理解与生成流畅性。
- 通过引入提示预训练与轻量级软提示微调,实现在极小参数更新下的高效少样本适配。
- 证明提示预训练与内提示对实现鲁棒的零样本与少样本摘要性能至关重要。
提出的方法
- 提出一种软提示架构,通过在编码器和解码器输入前插入连续嵌入,引导生成过程,而无需更新主模型参数。
- 引入三种类型的内提示——区间型、序列型与定长型,插入源文档内部,以在不同粒度上捕捉结构与语义信息。
- 实施两阶段训练范式:第一阶段,使用自监督伪数据进行提示预训练,以赋予基本摘要能力;第二阶段,仅用少量样本微调软提示。
- 使用冻结的预训练编码器-解码器模型(如BART),仅微调软提示嵌入,大幅减少可训练参数量。
- 利用注意力机制分析提示如何引导模型关注相关文档内容并生成流畅摘要。
- 通过启发式规则构建伪摘要语料库,以支持提示预训练,从而改善少样本适配的初始化效果。
实验结果
研究问题
- RQ1在编码器和解码器输入中均使用连续嵌入的软提示架构,能否有效实现少样本抽象摘要?
- RQ2在源文本中引入内提示是否能提升模型对文档结构与语义的理解?
- RQ3提示预训练是否为实现强大少样本与零样本摘要性能所必需?
- RQ4与全模型微调及现有提示调优基线(如提示调优与前缀调优)相比,所提出的PSP方法在性能与效率上表现如何?
- RQ5不同类型的内提示(区间型、序列型、定长型)在多大程度上促进摘要质量与模型稳定性?
主要发现
- PSP在CNN/DailyMail与XSum数据集上仅微调模型参数的0.1%即达到SOTA性能,在少样本设置下超越全模型微调。
- 模型显著优于标准提示调优,表明提示调优本身在抽象摘要任务中效果有限。
- PSP在仅使用3%可训练参数的情况下,性能与前缀调优相当,凸显其卓越的参数效率。
- 消融实验确认,提示预训练与内提示均至关重要:移除任一均导致性能显著下降且方差增大,尤其在更抽象的XSum数据集上表现明显。
- 注意力可视化显示,模型能有效学习关注相关文档内容,并在软提示引导下生成流畅、连贯的摘要。
- 提示预训练阶段显著提升了零样本泛化能力,表明其在少样本微调前初始化有效软提示的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。