[论文解读] Improving Non-autoregressive Generation with Mixup Training
本文提出MIST,一种新颖的训练方法,通过在训练过程中动态混合源输入与模型生成的伪目标序列,提升非自回归文本生成性能。通过实现无需影响推理速度的迭代优化,MIST在使用预训练编码器模型(如BERT和UniLM)时,在摘要生成、问题生成和释义任务上均取得了最先进结果。
While pre-trained language models have achieved great success on various natural language understanding tasks, how to effectively leverage them into non-autoregressive generation tasks remains a challenge. To solve this problem, we present a non-autoregressive generation model based on pre-trained transformer models. To bridge the gap between autoregressive and non-autoregressive models, we propose a simple and effective iterative training method called MIx Source and pseudo Target (MIST). Unlike other iterative decoding methods, which sacrifice the inference speed to achieve better performance based on multiple decoding iterations, MIST works in the training stage and has no effect on inference time. Our experiments on three generation benchmarks including question generation, summarization and paraphrase generation, show that the proposed framework achieves the new state-of-the-art results for fully non-autoregressive models. We also demonstrate that our method can be used to a variety of pre-trained models. For instance, MIST based on the small pre-trained model also obtains comparable performance with seq2seq models.
研究动机与目标
- 解决如何有效将预训练编码器模型适配到非自回归文本生成任务的挑战。
- 在不牺牲推理速度的前提下,弥合自回归模型与非自自回归模型之间的性能差距。
- 开发一种通过动态数据增强提升模型收敛与泛化能力的训练策略。
- 在不修改模型架构的前提下,使现有预训练模型(如BERT、UniLM)可用于非自回归生成。
- 在多种生成任务与预训练模型架构上,实现一致的性能提升。
提出的方法
- 提出MIST,一种训练时迭代方法,将原始源序列与模型生成的伪目标序列作为输入进行组合。
- 在训练过程中,模型首先生成完整的目标序列,随后将其作为输入的一部分用于第二次前向传播。
- 该过程生成随训练进展而演化的、模型感知的动态数据增强,提升对齐效果并减少过拟合。
- 该方法利用Transformer解码器中的自注意力与交叉注意力机制,建模混合输入中的依赖关系。
- MIST应用于微调阶段,不改变推理过程,从而保持非自回归模型的速度优势。
- 该方法支持条件依赖建模,并通过突出显示易错标记,帮助模型聚焦于错误预测。
实验结果
研究问题
- RQ1像MIST这样简单的训练时方法,能否有效弥合自回归与非自回归模型之间的性能差距?
- RQ2对源序列与伪目标序列进行动态混合,是否能提升非自回归生成中的泛化能力与收敛性?
- RQ3MIST能否在不修改架构的前提下,有效应用于多种预训练编码器模型(如BERT、UniLM、MiniLM)?
- RQ4与Mask-Predict等迭代解码方法相比,MIST在性能稳定性与收敛速度方面表现如何?
- RQ5MIST在多大程度上能使小型预训练模型达到甚至超越大规模自回归或序列到序列预训练模型的性能?
主要发现
- MIST在三个NLG基准上取得最先进结果:SQuAD1.1(ROUGE-L 46.49)、XSum(ROUGE-L 28.70)和Quora(BLEU-4 29.77)。
- 在SQuAD1.1上,MIST相比基线模型ROUGE-L提升0.82分,相比静态混合方法提升0.75分,证明其动态数据增强更优。
- MIST收敛速度优于基线,在XSum任务上仅用一半训练步数即达到更优性能。
- MIST在迭代解码中优于Mask-Predict,在1、3和6次迭代下均表现更稳定,尤其在SQuAD1.1和Quora任务中优势显著。
- 使用MiniLM配合MIST,在XSum上ROUGE-L达21.00,在SQuAD1.1上BLEU-4达12.98,性能可与大规模自回归模型BANG媲美。
- MIST使BERT和UniLM等预训练NLU模型实现强劲性能,使用UniLM在XSum上ROUGE-L达47.13,某些设置下超越BANG。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。