[论文解读] Non-Autoregressive Text Generation with Pre-trained Language Models
该论文提出了一种基于 BERT 作为主干网络的非自回归文本生成框架,通过可学习的 [eos] 标记实现动态长度控制,并引入上下文感知的学习目标以减少重复生成。该方法在非自回归模型中实现了最先进性能,在生成质量上与自回归模型相当,同时通过一种新颖的比率优先解码策略实现了更快的推理速度。
Non-autoregressive generation (NAG) has recently attracted great attention due to its fast inference speed. However, the generation quality of existing NAG models still lags behind their autoregressive counterparts. In this work, we show that BERT can be employed as the backbone of a NAG model to greatly improve performance. Additionally, we devise mechanisms to alleviate the two common problems of vanilla NAG models: the inflexibility of prefixed output length and the conditional independence of individual token predictions. Lastly, to further increase the speed advantage of the proposed model, we propose a new decoding strategy, ratio-first, for applications where the output lengths can be approximately estimated beforehand. For a comprehensive evaluation, we test the proposed model on three text generation tasks, including text summarization, sentence compression and machine translation. Experimental results show that our model significantly outperforms existing non-autoregressive baselines and achieves competitive performance with many strong autoregressive models. In addition, we also conduct extensive analysis experiments to reveal the effect of each proposed component.
研究动机与目标
- 提升非自回归模型的生成质量,因为这类模型通常在性能上逊于自回归模型。
- 通过在推理过程中实现动态长度决定,解决原始 NAG 模型中输出长度固定的僵化问题。
- 缓解导致非自回归模型生成重复且不自然输出的条件独立性假设。
- 提升输出长度比可预测任务(如文本摘要和句子压缩)的推理效率。
- 在保持非自回归生成速度优势的同时,实现与自回归模型相当的性能表现。
提出的方法
- 采用 BERT 作为编码器主干网络,并在其上添加 CRF 层以建模输出端依赖关系,提升序列连贯性。
- 引入可学习的 [eos] 标记机制,使模型能够动态决定生成停止时机,从而无需进行长度预测或长度并行解码。
- 提出一种上下文感知的学习目标,通过惩罚相邻位置产生相同或相似预测来减少重复。
- 采用比率优先解码策略,根据目标序列与源序列长度比的先验知识,仅处理源端隐藏状态的 α 比例。
- 将长度并行解码(LPD)作为基线方法,即生成多个长度候选并使用独立模型进行重排序。
- 对 BERT 编码器、CRF 层和 [eos] 标记预测头进行端到端联合优化,以训练完整模型。
实验结果
研究问题
- RQ1BERT 是否可被有效适配为非自回归文本生成的主干网络,以提升生成质量?
- RQ2通过可学习的 [eos] 标记实现动态长度控制,是否在质量与速度上均优于固定长度或长度并行解码策略?
- RQ3上下文感知学习目标能否有效减少重复并提升非自回归生成的流畅性?
- RQ4比率优先解码策略在多大程度上提升了推理速度,同时不损害生成质量?
- RQ5在多种文本生成任务中,该模型与强自回归模型相比性能如何?
主要发现
- 在 IWSLT14 DE-EN 翻译数据集上,该模型取得了 30.45 的 BLEU 分数,优于 LPD-10 基线(27.15),并达到使用更慢解码策略模型的性能水平。
- 与自回归模型相比,该模型实现了 11.31 倍的推理加速,与 LPD-1 解码速度相当,但在生成质量上显著更优。
- 在 Gigawords 数据集上,采用比率优先解码策略时,当 α = 0.3 时,模型实现了 9.31 倍的加速,达到速度与质量的最佳平衡。
- Gigawords 数据集中目标-源序列长度比的分布显示,70% 的样本比例低于 0.3,这为选择 α = 0.3 以实现最优性能提供了依据。
- 消融实验表明,动态长度机制与上下文感知目标均对性能提升有显著贡献,尤其在减少重复和提升流畅性方面。
- 在文本摘要、句子压缩和机器翻译等任务中,该模型与强自回归模型相比取得了具有竞争力的结果,证明了基于 BERT 的非自回归生成在高质量生成任务中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。