Skip to main content
QUICK REVIEW

[论文解读] Positional Encoding to Control Output Sequence Length

Sho Takase, Naoaki Okazaki|arXiv (Cornell University)|Apr 16, 2019
Topic Modeling参考文献 17被引用 9
一句话总结

本文提出了一种长度依赖的位置编码(LDPE 和 LRPE),将 Transformer 的正弦位置编码扩展为通过编码与目标长度的距离来控制输出序列长度。该方法实现了精确的长度控制,并提升了 ROUGE 分数,即使在训练期间未见过的长度上也表现优异,优于先前在标题生成任务中的方法。

ABSTRACT

Neural encoder-decoder models have been successful in natural language generation tasks. However, real applications of abstractive summarization must consider additional constraint that a generated summary should not exceed a desired length. In this paper, we propose a simple but effective extension of a sinusoidal positional encoding (Vaswani et al., 2017) to enable neural encoder-decoder model to preserves the length constraint. Unlike in previous studies where that learn embeddings representing each length, the proposed method can generate a text of any length even if the target length is not present in training data. The experimental results show that the proposed method can not only control the generation length but also improve the ROUGE scores.

研究动机与目标

  • 解决神经编码器-解码器模型在抽取式摘要生成中缺乏长度控制的问题。
  • 实现对任意目标长度的摘要生成,包括训练数据中不存在的长度。
  • 在标题生成任务中,同时提升长度控制精度和摘要质量(ROUGE 分数)。
  • 以连续、可微的方式扩展正弦位置编码,编码剩余长度或长度比例。

提出的方法

  • 将 Transformer 的正弦位置编码扩展,将目标长度作为可学习输入,从而生成长度差(LDPE)和长度比(LRPE)编码。
  • LDPE 编码当前位置与目标长度之间的差值,确保相同剩余长度时具有相同的编码值。
  • LRPE 编码当前位置与目标长度的比值,使模型在具有相似相对进度的不同长度间实现泛化。
  • 将修改后的位置编码添加到解码器输入层的词嵌入中,在推理过程中取代标准位置编码。
  • 训练时使用参考摘要的真实长度作为目标长度;推理时指定期望的长度。
  • 该方法采用长度的连续表示,使模型在无需微调的情况下即可泛化到未见过的长度。

实验结果

研究问题

  • RQ1是否可以扩展位置编码,以在不使用长度特定嵌入的情况下控制 Transformer 的输出序列长度?
  • RQ2模型是否能生成高质量摘要,且目标长度任意,即使这些长度在训练数据中极为罕见或完全不存在?
  • RQ3与基线方法相比,引入到终点位置的距离编码是否能同时提升长度控制精度和 ROUGE 分数?
  • RQ4与 LenEmb、LenInit 和 LC 等先前方法相比,该方法在长度控制和生成质量方面表现如何?

主要发现

  • LDPE 在日本语测试集上对目标长度 30 和 50 的长度控制最为精确,方差为 0.00。
  • 即使在训练数据中排除目标长度的情况下,该方法仍保持较高的 ROUGE 分数,表明其对未见过长度具有良好的泛化能力。
  • 在 DUC-2004 英语测试集上,LDPE 和 LRPE 显著优于基线 Transformer 及先前方法的 ROUGE 分数,其中 LRPE+PE+重排序方法超越了当时最先进结果。
  • 对于极短标题(长度=30),与基线 Transformer 相比,该方法的 ROUGE-2 分数略有下降,但这是由于基线本身具备生成短摘要的固有能力,而非方法本身的缺陷。
  • 在日本语数据中,对于长度为 10 的目标,生成长度与目标长度之间的平均绝对差仅为 0.1,表明精度极高。
  • 基于源文本词重叠的重排序进一步提升了标题质量,其中 Transformer+LRPE+PE+重排序在 DUC-2004 上取得了最高的 ROUGE 分数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。