Skip to main content
QUICK REVIEW

[论文解读] UniSumm and SummZoo: Unified Model and Diverse Benchmark for Few-Shot Summarization

Yulong Chen, Yang Liu|arXiv (Cornell University)|Nov 17, 2022
Natural Language Processing Techniques被引用 4
一句话总结

本文提出 UniSumm,一种在多种摘要任务上预训练的统一少样本摘要模型,并通过前缀调优(prefix-tuning)微调以适应新任务,实现了最先进性能。同时提出 SummZoo,一个稳健且多样化的基准,包含 8 项任务及每项任务 5 个少样本集合,支持公平评估。UniSumm 在自动评估中优于强基线模型,在人类评估中表现与 GPT-3.5 相当,且在不同少样本样本间表现出更强的稳定性。

ABSTRACT

The high annotation costs and diverse demands of various summarization tasks motivate the development of few-shot summarization. However, despite the emergence of many summarization tasks and datasets, the current training paradigm for few-shot summarization systems ignores potentially shareable knowledge in heterogeneous datasets. To this end, we propose extsc{UniSumm}, a unified few-shot summarization model pre-trained with multiple summarization tasks and can be prefix-tuned to excel at any few-shot summarization task. Meanwhile, to better evaluate few-shot summarizers, under the principles of diversity and robustness, we assemble and release a new benchmark extsc{SummZoo}. It consists of $8$ summarization tasks with multiple sets of few-shot samples for each task, covering diverse domains. Experimental results and analysis show that extsc{UniSumm} outperforms strong baselines by a large margin across all sub-tasks in extsc{SummZoo} under both automatic and human evaluations and achieves comparable results in human evaluation compared with a GPT-3.5 model.

研究动机与目标

  • 通过在不同数据集间共享知识,实现对多种摘要任务的少样本适应,以应对摘要任务的高成本与多样性挑战。
  • 通过利用现有摘要数据集中的跨任务知识,克服直接在新任务上微调的局限性。
  • 开发一种统一的预训练框架,结合多任务学习与前缀调优,实现有效的少样本适应。
  • 构建一个稳健且多样的基准,以实现对少样本摘要器的公平可靠评估,最小化样本选择偏差。
  • 通过统一的训练与调优范式,确保模型在不同少样本样本间的泛化能力与稳定性。

提出的方法

  • 使用多任务学习与任务特定及通用前缀向量,在 8 个不同摘要数据集上对统一的基于 Transformer 的模型进行预训练。
  • 在预训练过程中应用非对称权重衰减,以平衡共享参数与任务特定前缀,提升知识迁移效果。
  • 在少样本适应阶段采用前缀调优:冻结主干网络,仅微调通用前缀以适应新任务。
  • 使用预训练的通用前缀初始化前缀调优,以提升零样本迁移能力与适应速度。
  • 构建 SummZoo,包含 8 项涵盖不同领域、格式与长度的摘要任务,每项任务包含 5 个独立的少样本训练集。
  • 通过要求对每项任务的所有 5 个少样本集取平均结果,实现标准化评估,以确保稳健性与公平性。

实验结果

研究问题

  • RQ1在多个摘要任务上预训练的统一模型,能否有效泛化到未见过的少样本摘要任务?
  • RQ2与直接微调相比,使用预训练通用前缀的前缀调优在少样本摘要性能上表现如何?
  • RQ3通过多样化数据集进行多任务预训练,在多大程度上提升了模型在不同少样本样本间的鲁棒性与稳定性?
  • RQ4与现有基准相比,所提出的 SummZoo 基准在评估少样本摘要器时,如何提升公平性与可靠性?
  • RQ5统一模型能否在人类评估中实现与 GPT-3.5 等大型自回归模型相当的性能,同时在不同少样本数据下表现出更强的稳定性?

主要发现

  • 在 SummZoo 的所有子任务中,UniSumm 在自动评估指标上均优于强基线模型,表现出一致的优越性。
  • 在人类评估中,UniSumm 的表现与 GPT-3.5 模型(text-davinci-002)相当,且在不同少样本样本间表现出显著更高的稳定性。
  • 消融实验证明,多任务预训练与前缀调优的结合对 UniSumm 的性能至关重要,若任一组件被移除,性能均出现显著下降。
  • UniSumm 对样本选择偏差具有更强鲁棒性,在每项任务的全部 5 个少样本集中均保持高性能,而基线模型表现差异较大。
  • 预训练得到的通用前缀可作为前缀调优的有效初始化,实现对新任务的快速且高效的适应。
  • SummZoo 通过每项任务设置多个少样本集的设计,实现了更公平、更可靠的评估,降低了模型比较中的方差与偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。