Skip to main content
QUICK REVIEW

[论文解读] Denoising based Sequence-to-Sequence Pre-training for Text Generation

Liang Wang, Wei Zhao|arXiv (Cornell University)|Aug 22, 2019
Topic Modeling参考文献 62被引用 5
一句话总结

本文提出 PoDA,一种基于去噪的序列到序列预训练方法,通过使用噪声污染的文本序列联合微调编码器和解码器组件。通过在大规模无标签文本上进行词序打乱、删除或替换的预训练,PoDA 在摘要生成和语法错误纠正任务上实现了最先进或具有竞争力的性能,显著加速了收敛过程,且无需针对特定任务进行修改。

ABSTRACT

This paper presents a new sequence-to-sequence (seq2seq) pre-training method PoDA (Pre-training of Denoising Autoencoders), which learns representations suitable for text generation tasks. Unlike encoder-only (e.g., BERT) or decoder-only (e.g., OpenAI GPT) pre-training approaches, PoDA jointly pre-trains both the encoder and decoder by denoising the noise-corrupted text, and it also has the advantage of keeping the network architecture unchanged in the subsequent fine-tuning stage. Meanwhile, we design a hybrid model of Transformer and pointer-generator networks as the backbone architecture for PoDA. We conduct experiments on two text generation tasks: abstractive summarization, and grammatical error correction. Results on four datasets show that PoDA can improve model performance over strong baselines without using any task-specific techniques and significantly speed up convergence.

研究动机与目标

  • 解决现有预训练方法仅对序列到序列模型中的编码器或解码器之一进行预训练的局限性。
  • 开发一种统一的预训练方法,联合优化文本生成任务中编码器和解码器的表示。
  • 通过利用大规模无标签文本的预训练表示,加速微调阶段的收敛。
  • 在预训练和微调阶段保持架构一致性,避免结构上的更改。

提出的方法

  • PoDA 采用混合架构,结合 Transformer 编码器和解码器,并引入 pointer-generator 输出层,以支持生成和复制机制。
  • 使用三种去噪函数——随机打乱、删除和替换——作用于输入序列,生成用于去噪任务的噪声输入。
  • 去噪目标训练模型从噪声输入中重建原始干净序列,从而学习鲁棒的上下文表征。
  • 预训练在大规模单语语料库上进行,包括 Billion Word Benchmark 和 English Wikipedia,总计约 29.9 亿词。
  • 该方法兼容多种序列到序列架构,包括 Transformer 和 ConvS2S,且在微调阶段无需架构更改。
  • 微调阶段采用最大似然训练,不依赖于课程学习或调度采样等任务特定技术。

实验结果

研究问题

  • RQ1去噪自编码器预训练策略是否能同时提升序列到序列模型在文本生成任务中编码器和解码器的表征?
  • RQ2与单独预训练相比,联合预训练编码器和解码器是否能带来更快的收敛速度和更好的下游文本生成任务性能?
  • RQ3PoDA 在无需任务特定架构或训练修改的情况下,对抽象摘要生成和语法错误纠正任务的有效性如何?
  • RQ4去噪函数的选择(打乱、删除、替换)在多大程度上影响模型性能和鲁棒性?
  • RQ5PoDA 是否能在保持架构简洁性的同时,实现最先进性能,并与标准微调流程保持兼容?

主要发现

  • PoDA 在四个基准数据集——CNN/Daily Mail、Gigaword、CoNLL-2014 和 JFLEG 上实现了优越或具有竞争力的性能,且未使用任何任务特定技术。
  • 该模型收敛速度显著快于基线模型:在 CNN/Daily Mail 和 Gigaword 数据集上,PoDA 仅用 5 个周期就达到验证困惑度,而非预训练版本需 30 多个周期才能达到。
  • 预训练步骤显著提升了所有四个数据集上的模型性能,证明了联合编码器-解码器预训练的有效性。
  • 结合使用多种去噪函数(打乱、删除、替换)并配合 beta 分布先验,增强了模型对不同噪声水平的鲁棒性。
  • 该方法在预训练和微调阶段保持了架构一致性,避免了模型重新配置的需要。
  • 代码和预训练模型已公开发布于 https://github.com/yuantiku/PoDA,支持可复现性与进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。