Skip to main content
QUICK REVIEW

[论文解读] A Focused Study on Sequence Length for Dialogue Summarization

Bin Wang, Chen Zhang|arXiv (Cornell University)|Sep 24, 2022
Topic Modeling被引用 10
一句话总结

本文研究了对话摘要中摘要长度的关键作用,揭示了像 BART 和 T5 这类预训练模型由于其预训练目标,生成的摘要明显比人类参考摘要更冗长。通过将预测或真实摘要长度作为输入标记,作者证明了一种简单的长度感知适应(LA-BART)能提升 ROUGE 和 BERTScore 指标,同时减少长度方差,在 DialogSum 和 SAMSum 数据集上实现了接近人类水平的简洁性与性能提升。

ABSTRACT

Output length is critical to dialogue summarization systems. The dialogue summary length is determined by multiple factors, including dialogue complexity, summary objective, and personal preferences. In this work, we approach dialogue summary length from three perspectives. First, we analyze the length differences between existing models' outputs and the corresponding human references and find that summarization models tend to produce more verbose summaries due to their pretraining objectives. Second, we identify salient features for summary length prediction by comparing different model settings. Third, we experiment with a length-aware summarizer and show notable improvement on existing models if summary length can be well incorporated. Analysis and experiments are conducted on popular DialogSum and SAMSum datasets to validate our findings.

研究动机与目标

  • 探究当前最先进对话摘要模型为何生成的摘要比人类参考更冗长。
  • 分析摘要长度是否可从对话特征中预测,以及哪些特征对长度预测最具显著性。
  • 评估将摘要长度作为显式输入对模型性能与可控性的影响。
  • 证明简单的长度感知适应能显著提升摘要质量与长度一致性。

提出的方法

  • 作者在 DialogSum 和 SAMSum 数据集上对比模型输出与人类参考,量化长度差异及人类之间的共识度。
  • 利用对话特征(如对话长度、说话人数量、话语数量等)训练长度预测器,以估计参考摘要的长度。
  • 提出一种基于 BART 的长度感知模型(LA-BART),在解码过程中将摘要长度作为条件输入标记(例如,'Summary length: 25.')。
  • 评估三种变体:LA-BART v1(推理时使用预测长度)、LA-BART v2(推理时使用真实长度),以及一种联合预测摘要长度与生成摘要的多任务学习变体。
  • 采用 ROUGE 和 BERTScore 进行自动评估,人类评估则按 5 分制对摘要整体质量进行打分。
  • 统计分析包括预测与实际摘要长度之间的相关性度量(皮尔逊、斯皮尔曼、肯德尔相关系数)。

实验结果

研究问题

  • RQ1为何预训练对话摘要模型生成的摘要比人类参考更长?
  • RQ2哪些对话级特征最能预测摘要长度?
  • RQ3将预测或真实摘要长度作为输入注入,能否提升生成摘要的简洁性与质量?
  • RQ4与标准自回归生成相比,长度感知生成在 ROUGE、BERTScore 和长度方差方面表现如何?

主要发现

  • BART Large 生成的摘要平均长度为 54.2 个词,而人类参考摘要平均为 46.3 个词,绝对长度差异达 7.9 个词,表明存在显著的冗长问题。
  • 人类之间对长度的一致性较高(相关系数 r=76.9),而模型与人类之间的长度相关性较低(如 BART Large:r=74.6),表明模型未能匹配人类的长度一致性。
  • 使用真实长度输入的 LA-BART 在 DialogSum 上将绝对长度差异减少至 2.6 个词,在 SAMSum 上减少至 4.1 个词,实现了接近人类的长度准确性。
  • 使用预测长度的 LA-BART v1 在 DialogSum 上将长度差异从 7.9 个词减少至 5.5 个词,并将 BERTScore 从 51.6 提升至 52.3,显示出可测量的改进。
  • 联合进行长度预测与摘要生成的多任务学习方法,同时提升了长度预测准确率与摘要质量,BERTScore 在 DialogSum 上从 51.6 提升至 52.3。
  • 人类评估确认,使用真实长度输入的 LA-BART 在所有生成摘要中排名最高,优于标准 BART 和使用预测长度的 LA-BART。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。