[论文解读] Momentum Calibration for Text Generation
MoCa(动量校准)是一种在线方法,通过使用动量移动平均生成器将模型得分与束搜索生成样本的实际质量对齐,从而提升文本生成性能。该方法在CNN/DailyMail和SAMSum数据集上优于基线微调方法及当前最先进方法,以极低的计算开销实现了SOTA结果。
The input and output of most text generation tasks can be transformed to two sequences of tokens and they can be modeled using sequence-to-sequence learning modeling tools such as Transformers. These models are usually trained by maximizing the likelihood the output text sequence and assumes the input sequence and all gold preceding tokens are given during training, while during inference the model suffers from the exposure bias problem (i.e., it only has access to its previously predicted tokens rather gold tokens during beam search). In this paper, we propose MoCa ({\bf Mo}mentum {\bf Ca}libration) for text generation. MoCa is an online method that dynamically generates slowly evolving (but consistent) samples using a momentum moving average generator with beam search and MoCa learns to align its model scores of these samples with their actual qualities. Experiments on four text generation datasets (i.e., CNN/DailyMail, XSum, SAMSum and Gigaword) show MoCa consistently improves strong pre-trained transformers using vanilla fine-tuning and we achieve the state-of-the-art results on CNN/DailyMail and SAMSum datasets.
研究动机与目标
- 通过在训练过程中将模型得分与生成样本的实际质量对齐,解决文本生成中的暴露偏差和损失-评估不匹配问题。
- 通过使模型得分与束搜索中样本的相对质量保持一致,减少训练(MLE损失)与推理(束搜索)之间的差异。
- 开发一种在线、可微分的方法,动态生成一致且高质量的样本,实现实时校准。
- 在不改变模型架构或采用复杂训练方案的前提下,提升预训练Transformer模型的性能。
提出的方法
- MoCa使用动量移动平均生成器,在训练过程中生成缓慢演化的、一致的候选样本。
- 该方法利用外部评估模型(如ROUGE)评估样本质量,并将这些得分与在线模型预测的概率对齐。
- 应用排名损失,确保高质量样本获得更高的模型得分,从而提升束搜索性能。
- 在线模型采用专为束搜索设计的评分函数,并引入位置加权机制,以纠正长序列中因位置准确性下降导致的性能下降。
- 动量更新策略确保生成器稳定、渐进地演化,保持样本间的一致性。
- 该方法具有可微性,避免了强化学习中非可微奖励的问题,支持端到端训练。
实验结果
研究问题
- RQ1在线、动态样本生成能否提升束搜索中模型得分与实际样本质量之间的对齐程度?
- RQ2与静态或孤立的样本生成相比,基于动量的生成器是否能提升一致性和性能?
- RQ3可微分的在线校准方法能否在文本生成中超越强化学习和调度采样方法?
- RQ4为束搜索定制的评分函数结合位置加权机制,对长序列生成任务的性能有何影响?
- RQ5MoCa在超越基线微调的基础上,能在多大程度上提升强预训练模型的性能?
主要发现
- MoCa在CNN/DailyMail(ROUGE-L 45.76)和SAMSum(ROUGE-L 50.88)上达到SOTA结果,优于所有基线方法,包括参数更大的模型。
- 在XSum上,MoCa优于参数量更大的400M和568M参数模型(如PEGASUS和BART),尽管其参数量小于268B参数的ST-MoE模型。
- MoCa在所有数据集上均持续优于基线微调方法,在CNNDM上ROUGE-L提升0.56,在SAMSum上提升1.51。
- 消融实验表明,与离线方法相比,在线动量更新能进一步提升性能,最佳效果在结合动量与自适应位置加权时达到。
- 在SAMSum上,位置加权(γt = 1)表现更优,因该任务中位置准确性易下降;而在CNNDM上,恒定加权表现更佳。
- 尽管模型参数更小,MoCa仍优于BRIO和SLiC,证明了在线校准与束搜索感知评分机制的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。