[论文解读] s2s-ft: Fine-Tuning Pretrained Transformer Encoders for Sequence-to-Sequence Learning
该论文介绍了 s2s-ft,一个用于微调预训练双向 Transformer(如 BERT、RoBERTa、UniLM)以执行序列到序列生成任务的工具包,采用三种新颖的微调策略:因果、掩码和伪掩码微调。通过利用统一的自注意力掩码和共享模型参数,s2s-ft 在单语和多语种基准上的抽象摘要和问题生成任务中实现了最先进性能,优于更大的模型如 T5-11B 和 PEGASUS。
Pretrained bidirectional Transformers, such as BERT, have achieved significant improvements in a wide variety of language understanding tasks, while it is not straightforward to directly apply them for natural language generation. In this paper, we present a sequence-to-sequence fine-tuning toolkit s2s-ft, which adopts pretrained Transformers for conditional generation tasks. Inspired by UniLM, we implement three sequence-to-sequence fine-tuning algorithms, namely, causal fine-tuning, masked fine-tuning, and pseudo-masked fine-tuning. By leveraging the existing pretrained bidirectional Transformers, experimental results show that s2s-ft achieves strong performance on several benchmarks of abstractive summarization, and question generation. Moreover, we demonstrate that the package s2s-ft supports both monolingual and multilingual NLG tasks. The s2s-ft toolkit is available at https://github.com/microsoft/unilm/tree/master/s2s-ft.
研究动机与目标
- 为解决将预训练的双向 Transformer(如 BERT)适配到序列到序列生成任务的挑战,因为其双向注意力机制在该任务中并不直接适用。
- 在单一 Transformer 架构中统一编码与解码过程,以减少预训练与微调目标之间的差异。
- 开发一个灵活的开源工具包,使现有预训练模型能够用于多种条件生成任务的微调,包括抽象摘要和问题生成。
- 通过使用 XLM-RoBERTa 等模型,在单语和多语种生成任务中验证该方法的有效性。
- 证明无需任务特定的预训练或大规模模型重训练,仅通过在现有预训练模型上进行最小的架构修改,即可实现优异性能。
提出的方法
- s2s-ft 工具包采用统一的 Transformer 架构,将源序列和目标序列打包为单个输入序列,并使用特殊标记 [CLS]、[SEP] 和 [SOS] 标注序列边界。
- 通过任务特定的自注意力掩码限制注意力机制:源标记可双向注意,而目标标记仅能注意其之前的目标标记和源标记,从而实现自回归生成。
- 因果微调将目标位置向右移动,通过左到右注意力实现自回归预测,类似于因果语言建模。
- 掩码微调在训练期间随机掩码目标标记并预测它们,以最小化预训练(掩码语言建模)与微调之间的不匹配。
- 伪掩码微调为每个目标标记插入一个伪掩码标记,并为其分配相同的位置嵌入,结合了因果和掩码训练的优点。
- 该工具包基于 HuggingFace Transformers 构建,支持单语和多语模型(包括 RoBERTa 和 XLM-RoBERTa),可实现零样本或少样本适应。
实验结果
研究问题
- RQ1未经架构重构,预训练的双向 Transformer(如 BERT)能否被有效微调以用于序列到序列生成任务?
- RQ2在抽象摘要和问题生成任务中,因果、掩码和伪掩码微调策略的性能表现如何比较?
- RQ3使用 s2s-ft,现成的预训练模型(包括多语种模型如 XLM-RoBERTa)能否在多语种生成任务中实现强性能?
- RQ4s2s-ft 中的统一建模方法是否能减少预训练与微调之间的领域差距,从而提升泛化能力?
- RQ5s2s-ft 是否能在无需任务特定预训练或大规模模型重训练的情况下实现最先进性能?
主要发现
- 使用 UniLMv2-LARGE 的 s2s-ft 在 XSum 上达到 27.12 的 ROUGE-L,在 CNN/DailyMail 上达到 54.25 的 ROUGE-L,优于更大的模型如 T5-11B 和 PEGASUS。
- 使用 RoBERTa-LARGE 的 s2s-ft 在 XSum 上达到 26.82 的 ROUGE-L,在 CNN/DailyMail 上达到 53.92 的 ROUGE-L,展示了在基础规模模型上的强劲性能。
- 在多语种抽象摘要任务中,使用 XLM-RoBERTa-LARGE 的 s2s-ft 在中文 Gigaword 上达到 58.09 的 ROUGE-L,在法语 Gigaword 上达到 55.04 的 ROUGE-L,优于 XLM 和 XNLG 基线模型。
- 在中文问题生成任务中,使用 XLM-RoBERTa-LARGE 的 s2s-ft 达到 28.49 的 BLEU-4 和 52.94 的 METEOR,优于 XLM 和 XNLG 模型。
- 伪掩码微调方法在所有基准测试中均持续取得最佳性能,表明其在平衡预训练与微调目标方面的有效性。
- 该工具包在多语种任务中实现了强大的零样本和少样本性能,表明多语种预训练模型可通过极少的适应被有效重用于生成任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。