Skip to main content
QUICK REVIEW

[论文解读] Discriminative Adversarial Search for Abstractive Summarization

Thomas Scialom, Paul-Alexis Dray|arXiv (Cornell University)|Feb 24, 2020
Speech Recognition and Synthesis参考文献 52被引用 9
一句话总结

本文提出了一种新型序列解码方法——判别式对抗搜索(DAS),该方法在推理阶段利用训练好的判别器引导束搜索,从而在不更新生成器参数的情况下提升抽取式摘要的质量。DAS 有效缓解了暴露偏差问题,在 CNN/DM 和 TL;DR 基准测试中实现了最先进(SOTA)的 ROUGE 分数,通过判别器微调可进一步提升性能,并在无需基于规则的过滤条件下展现出优异的跨领域适应能力。

ABSTRACT

We introduce a novel approach for sequence decoding, Discriminative Adversarial Search (DAS), which has the desirable properties of alleviating the effects of exposure bias without requiring external metrics. Inspired by Generative Adversarial Networks (GANs), wherein a discriminator is used to improve the generator, our method differs from GANs in that the generator parameters are not updated at training time and the discriminator is only used to drive sequence generation at inference time. We investigate the effectiveness of the proposed approach on the task of Abstractive Summarization: the results obtained show that a naive application of DAS improves over the state-of-the-art methods, with further gains obtained via discriminator retraining. Moreover, we show how DAS can be effective for cross-domain adaptation. Finally, all results reported are obtained without additional rule-based filtering strategies, commonly used by the best performing systems available: this indicates that DAS can effectively be deployed without relying on post-hoc modifications of the generated outputs.

研究动机与目标

  • 为解决序列生成中的暴露偏差问题,即模型在训练时使用真实标签词元,但在推理时却无法依赖这些词元。
  • 通过优化生成结果以更贴近人类语言输出,而非依赖 BLEU 或 ROUGE 等外部指标,从而提升抽取式摘要质量。
  • 通过仅在新领域数据上微调判别器,实现仅用少量数据即可有效进行跨领域适应。
  • 消除解码过程中对后处理阶段基于规则的过滤策略(如长度惩罚、n-gram 重复避免)的依赖。
  • 开发一种通过判别器与生成器之间的反馈循环提升生成质量的方法,而无需重新训练生成器。

提出的方法

  • 预先训练一个判别器,用于区分人类书写的摘要与模型生成的摘要,训练数据包括真实序列和生成序列。
  • 在推理阶段,利用判别器输出的置信度分数对束搜索的概率进行重加权,优先选择更可能被分类为“人类风格”的序列。
  • 因此,束搜索受到一种动态、数据驱动的度量引导,该度量反映人类文本的分布,而非静态指标。
  • 生成完成后,使用新生成的序列对判别器进行微调,以增强其区分真实与虚假文本的能力,从而形成反馈循环。
  • 在整个过程中,生成器模型参数保持不变,确保无需额外训练。
  • 该方法应用于 CNN/DM 和 TL;DR 数据集上的抽取式摘要任务,并通过消融实验研究了领域适应与过滤策略的影响。

实验结果

研究问题

  • RQ1在推理阶段使用判别器是否能有效缓解序列生成中的暴露偏差,而无需重新训练生成器?
  • RQ2通过判别器引导束搜索是否能相比最先进方法显著提升 ROUGE 和 BLEU 分数?
  • RQ3判别器是否能通过在域外数据上微调实现有效的跨领域适应,且仅需极少数据?
  • RQ4DAS 是否能消除对基于规则的过滤策略(如长度惩罚、n-gram 重复避免)的需求?
  • RQ5在生成结果的人类语言流畅度与事实一致性方面,DAS 与强化学习或基于指标优化的解码方法相比表现如何?

主要发现

  • 在 CNN/DM 数据集上,DAS 在不使用任何基于规则的过滤策略的情况下,实现了 ROUGE-1、ROUGE-2 和 ROUGE-L 的新 SOTA 结果。
  • 在 TL;DR 数据集上,经过判别器微调(DAS-retrain)后,生成摘要的平均长度比人类参考摘要短 2.72 个词元,而 UniLM 的差距为 12.11 个词元,表明 DAS 具有更好的长度控制能力。
  • 在 TL;DR 数据集上,尽管仅使用 1,000 个样本进行判别器训练,DAS-retrain 仍能达到与 SOTA 模型相当的性能,显示出在领域适应中极高的数据效率。
  • DAS-retrain 生成摘要的词表分布比 UniLM 更接近人类书写的摘要,表明其用词更具人类风格。
  • DAS-retrain 在减少 3-gram 重复方面优于 UniLM,且在序列各位置上,生成摘要与人类摘要之间的重复差距显著缩小。
  • 在仅使用 1,000 个训练样本的情况下,判别器在 TL;DR 上达到了 82.5% 的准确率,证明其在数据有限条件下仍具备强大性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。