[论文解读] Controlling the Amount of Verbatim Copying in Abstractive Summarization
本文提出一种仅使用解码器的 Transformer 模型,通过从单个参考摘要中学习,控制生成摘要中的逐字复制行为。通过在训练和推理过程中分离对已见(可复制)和未见(生成)词汇的预测,该模型能够生成从抽取式到生成式摘要的各类摘要,实现与现有方法相当的 ROUGE 和 BERTScore 指标,同时支持对复制率的灵活控制。
An abstract must not change the meaning of the original text. A single most effective way to achieve that is to increase the amount of copying while still allowing for text abstraction. Human editors can usually exercise control over copying, resulting in summaries that are more extractive than abstractive, or vice versa. However, it remains poorly understood whether modern neural abstractive summarizers can provide the same flexibility, i.e., learning from single reference summaries to generate multiple summary hypotheses with varying degrees of copying. In this paper, we present a neural summarization model that, by learning from single human abstracts, can produce a broad spectrum of summaries ranging from purely extractive to highly generative ones. We frame the task of summarization as language modeling and exploit alternative mechanisms to generate summary hypotheses. Our method allows for control over copying during both training and decoding stages of a neural summarization model. Through extensive experiments we illustrate the significance of our proposed method on controlling the amount of verbatim copying and achieve competitive results over strong baselines. Our analysis further reveals interesting and unobvious facts.
研究动机与目标
- 使神经生成式摘要模型即使仅在单个参考摘要上进行训练,也能生成具有不同程度逐字复制的摘要。
- 解决现代生成式模型中缺乏复制控制的问题,这些模型通常产生固定复制率的输出。
- 开发一种框架,实现在训练和推理阶段均对复制行为进行控制。
- 通过受控复制减少幻觉现象并保留语义,从而提升摘要质量。
- 证明单参考模型能够在抽取式到生成式摘要的谱系上生成多样化的摘要假设。
提出的方法
- 该模型将摘要任务建模为语言建模任务,采用参数共享的仅解码器 Transformer 架构。
- 将预测过程分为两个部分:在源文中出现过的词汇(复制)和未出现过的词汇(生成),从而实现对复制行为的控制。
- 在训练过程中,模型接触不同比例的已见词与未见词,以学习倾向于或避免复制。
- 在推理阶段,采用搜索策略(如束搜索、最佳优先搜索)和重排序方法(如 BP-Norm、SBWR)以促进对源文本措辞的复制。
- 所有参数(包括注意力机制和复制机制)均使用预训练表示进行热启动,提升训练稳定性。
- 复制率定义为摘要中与源文本完全一致的 n-gram 占比,作为量化控制指标。
实验结果
研究问题
- RQ1在仅使用单个参考摘要进行训练的情况下,神经生成式摘要模型能否生成具有不同复制程度的摘要?
- RQ2所提出的方法在训练和推理阶段对复制行为的控制效果如何?
- RQ3该模型在抽取式和生成式摘要类型上是否均能取得具有竞争力的自动评估与人工评估得分?
- RQ4不同的解码策略(束搜索 vs. 最佳优先搜索)和重排序方法如何影响复制行为与摘要质量?
- RQ5该模型是否具备跨领域泛化能力?在跨领域设置下性能如何退化?
主要发现
- 该模型在仅使用单参考摘要的情况下,于 Gigaword 数据集上实现了与强基线模型相当的 ROUGE 和 BERTScore 指标。
- 束搜索结合 SBWR 重排序方法表现最佳,优于长度归一化和最佳优先搜索。
- 在跨领域设置下,复制率更高的模型(纯抽取式)比更生成式的变体退化得更平缓。
- 人工评估显示,该模型的两个变体在信息量、语法正确性和真实性方面均优于基线模型,其中最佳生成式变体在真实性上的得分为 2.865。
- 最佳-最差尺度分析表明,该模型的最佳生成式变体被选为最佳摘要的概率比最差变体高出 4.2%,显示出强烈的人工偏好。
- 该方法无需多参考摘要即可实现对复制行为的有效控制,证明了仅使用单个参考摘要即可实现灵活摘要生成的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。