[论文解读] Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks
本文提出Scheduled Sampling,一种课程学习方法,通过在循环神经网络进行序列预测训练过程中逐步用模型生成的预测替换真实标签(ground-truth)标记,以弥合训练与推理阶段的分布差异。该方法减少了错误累积,在图像字幕生成和语音识别等任务中显著提升了性能,相较于标准训练方式,解码准确率有显著提升。
Recurrent Neural Networks can be trained to produce sequences of tokens given some input, as exemplified by recent results in machine translation and image captioning. The current approach to training them consists of maximizing the likelihood of each token in the sequence given the current (recurrent) state and the previous token. At inference, the unknown previous token is then replaced by a token generated by the model itself. This discrepancy between training and inference can yield errors that can accumulate quickly along the generated sequence. We propose a curriculum learning strategy to gently change the training process from a fully guided scheme using the true previous token, towards a less guided scheme which mostly uses the generated token instead. Experiments on several sequence prediction tasks show that this approach yields significant improvements. Moreover, it was used successfully in our winning entry to the MSCOCO image captioning challenge, 2015.
研究动机与目标
- 解决RNN序列预测中训练与推理阶段的差异问题,即训练时使用真实标签,而推理时使用模型生成的标记。
- 通过在训练中让模型学习处理自身预测结果,减少自回归序列生成中的错误传播。
- 提升机器翻译、图像字幕生成和语音识别等序列生成任务中的泛化能力与鲁棒性。
- 开发一种训练策略,实现从监督训练到自监督生成的平滑过渡,模拟实际推理条件。
提出的方法
- Scheduled Sampling 引入一个采样概率 εt,用于控制在每个时间步训练时使用真实标签的概率与使用模型自身预测的概率。
- 采样概率 εt 在训练过程中从初始值 εs 线性递减至最终值 εe,实现从完全监督到完全自生成的渐进过渡。
- 在每个训练步骤 t,RNN 的输入为真实前一标记(概率为 εt)或模型预测的标记(概率为 1−εt),形成类似课程学习的训练调度。
- 模型在该随机输入调度下被训练以最大化目标序列的似然概率,使其在训练中学会纠正自身错误。
- 该方法应用于具有LSTM单元的RNN,其中隐藏状态基于前一隐藏状态和当前输入标记(真实或预测)进行更新。
- 推理阶段,模型仅使用自身预测结果,模拟实际部署条件;而训练过程通过渐进式课程调度为这一转变做好准备。
实验结果
研究问题
- RQ1一种在训练中逐步用模型生成预测替换真实标签的课程学习策略,能否提升序列生成性能?
- RQ2Scheduled Sampling 是否通过使训练更贴近推理条件,减少自回归RNN中的错误累积?
- RQ3Scheduled Sampling 在序列预测任务中与标准教师强制(teacher forcing)和完全自监督生成相比,性能如何?
- RQ4不同的采样调度策略(如 ε 的线性衰减)对模型泛化能力和解码准确率有何影响?
主要发现
- Scheduled Sampling 在 MSCOCO 图像字幕挑战中显著提升了解码性能,助力2015年获胜队伍。
- 在使用HMM对齐状态的语音识别任务中,基线模型的下一步预测错误率(FER)为15.0%,但解码错误率为46.0%,表明在推理条件下泛化能力差。
- 完全采样模型(ε=0)的解码错误率为35.8%,优于基线的46.0%,尽管其下一步预测错误率更差,说明自监督训练提升了鲁棒性。
- 最佳Scheduled Sampling配置(εs=0.5, εe=0)的解码错误率为35.0%,优于基线,表明渐进式课程训练能提升推理阶段性能。
- 最具攻击性的调度策略(εs=0.9, εe=0.5)的下一步错误率为19.8%,但解码错误率为42.0%,表明过早引入过多采样会损害训练稳定性。
- 结果表明,Scheduled Sampling 有效减少了训练与推理之间的分布偏移,从而在序列生成任务中实现更好的泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。