Skip to main content
QUICK REVIEW

[论文解读] Cascaded Text Generation with Markov Transformers

Yuntian Deng, Alexander M. Rush|arXiv (Cornell University)|Jun 1, 2020
Natural Language Processing Techniques参考文献 67被引用 11
一句话总结

本文提出一种基于马尔可夫变换器的级联解码方法,实现亚线性时间的自回归文本生成,结合了束搜索的准确性与并行推理的速度。通过训练单一模型以参数化更高阶的马尔可夫依赖关系,该方法在五个机器翻译基准测试中实现了高效且高质量的生成,其速度和准确率与非自回归基线模型相当或更优。

ABSTRACT

The two dominant approaches to neural text generation are fully autoregressive models, using serial beam search decoding, and non-autoregressive models, using parallel decoding with no output dependencies. This work proposes an autoregressive model with sub-linear parallel time generation. Noting that conditional random fields with bounded context can be decoded in parallel, we propose an efficient cascaded decoding approach for generating high-quality output. To parameterize this cascade, we introduce a Markov transformer, a variant of the popular fully autoregressive model that allows us to simultaneously decode with specific autoregressive context cutoffs. This approach requires only a small modification from standard autoregressive training, while showing competitive accuracy/speed tradeoff compared to existing methods on five machine translation datasets.

研究动机与目标

  • 为解决完全自回归模型依赖串行束搜索解码所导致的低效问题。
  • 通过利用有界马尔可夫依赖关系,实现在不牺牲生成质量的前提下快速、可并行化的文本生成。
  • 设计一种统一的神经架构——马尔可夫变换器,用于参数化结构化预测的级联图模型。
  • 与现有的非自回归方法及束搜索方法相比,实现具有竞争力的速度-准确率权衡。
  • 在神经文本生成中实现高效的多GPU扩展和可变长度生成。

提出的方法

  • 引入马尔可夫变换器,即在训练期间将自注意力限制在固定上下文窗口 M 内的标准变换器变体,使其能够学习高阶马尔可夫依赖关系。
  • 采用级联解码:从零阶(非自回归)模型开始,通过逐步使用更高阶马尔可夫模型(一阶、二阶等)并增加上下文进行迭代优化预测。
  • 通过蒸馏将完整自回归变换器的知识迁移至级联系统,提升性能而不增加推理时间。
  • 使用最大边际概率代替 n-gram 分数进行剪枝,以最小计算成本提升不同位置间的兼容性。
  • 通过在设备间划分序列实现多GPU推理,每轮迭代仅需日志级通信。
  • 通过最大似然训练马尔可夫变换器,在强制上下文截断的同时保持完整的自回归训练目标。

实验结果

研究问题

  • RQ1我们能否在保持高生成质量的前提下,实现在自回归模型中的亚线性时间解码?
  • RQ2一个单一神经模型能否参数化用于文本生成结构化预测的、阶数逐级提高的马尔可夫模型级联?
  • RQ3使用马尔可夫变换器的级联解码是否在速度-准确率权衡上优于束搜索和非自回归方法?
  • RQ4蒸馏能否在不增加推理时间的前提下提升级联解码的性能?
  • RQ5该方法能否在多GPU上高效扩展并支持可变长度序列生成?

主要发现

  • 在 WMT14 En-De 数据集上,经过蒸馏的级联马尔可夫变换器实现了 35.03 的 BLEU 分数,推理时间为 33.45ms,速度和准确率均优于非自回归基线模型。
  • 四阶马尔可夫变换器配合束搜索(K=5)实现了 35.07 的 BLEU 分数,接近完整变换器的 35.63,表明在有限上下文下仍具有强大表达能力。
  • 在长度约束下进行级联解码优于严格长度强制,显示出灵活序列长度建模的优势。
  • 使用 4 块 GPU 时,相比单 GPU 的 1.68× 加速,实现了 2.79× 的加速比,表明由于通信局部化,该方法具有强大的多GPU可扩展性。
  • 与使用 n-gram 分数(123.48ms)相比,使用最大边际概率在 WMT14 En-De 验证集上将 BLEU 从 28.42 提升至 29.24(推理时间 128.58ms),仅带来少量时间开销。
  • 该方法实现了 O(log L) 的并行时间复杂度,其中 log L 项在实际中可忽略不计,使其接近 O(1) 的非自回归模型速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。