Skip to main content
QUICK REVIEW

[论文解读] Optimal Completion Distillation for Sequence Learning

Sara Sabour, William Chan|arXiv (Cornell University)|Oct 2, 2018
Natural Language Processing Techniques参考文献 67被引用 5
一句话总结

本文提出最优完成蒸馏(Optimal Completion Distillation, OCD),一种新型序列到序列模型训练方法,基于编辑距离并利用动态规划识别生成前缀的最优后缀。OCD 在端到端语音识别任务中取得最先进性能,在 Wall Street Journal 数据集上达到 9.3% WER,在 Librispeech test-clean 上达到 4.5% WER,无需语言模型重排序,且无需额外超参数,优于 MLE 和先前方法。

ABSTRACT

We present Optimal Completion Distillation (OCD), a training procedure for optimizing sequence to sequence models based on edit distance. OCD is efficient, has no hyper-parameters of its own, and does not require pretraining or joint optimization with conditional log-likelihood. Given a partial sequence generated by the model, we first identify the set of optimal suffixes that minimize the total edit distance, using an efficient dynamic programming algorithm. Then, for each position of the generated sequence, we use a target distribution that puts equal probability on the first token of all the optimal suffixes. OCD achieves the state-of-the-art performance on end-to-end speech recognition, on both Wall Street Journal and Librispeech datasets, achieving $9.3\%$ WER and $4.5\%$ WER respectively.

研究动机与目标

  • 开发一种序列到序列模型的训练方法,直接基于编辑距离进行优化,避免依赖最大似然估计(MLE)。
  • 消除对超参数调优、预训练或与对数似然联合优化的需求。
  • 通过教导模型生成最小化与真实序列编辑距离的序列,提升端到端语音识别性能。
  • 提供一种可扩展、高效且无需超参数的现有序列优化方法替代方案。

提出的方法

  • 对于模型生成的每个前缀,OCD 使用动态规划计算所有能最小化与真实序列总编辑距离的最优后缀。
  • 定义一个目标分布,为每个最优后缀的第一个词元分配相等的概率,从而实现最优完成策略的蒸馏。
  • 模型被训练以最大化这些第一个词元的平均对数概率,从而有效学习如何最优地扩展前缀。
  • 该方法以在线方式运行,使用从待训练模型中采样的策略轨迹。
  • 对于长度为 n 的生成序列和长度为 m 的目标序列,算法时间复杂度为 O(nm),适用于长序列,效率较高。
  • 避免 MLE 初始化,且无需与条件对数似然联合优化,支持独立训练。

实验结果

研究问题

  • RQ1能否在不依赖 MLE 或辅助目标的情况下,直接训练序列到序列模型以最小化编辑距离?
  • RQ2能否利用动态规划高效计算任意生成前缀的最优完成后缀?
  • RQ3蒸馏最优完成策略是否能带来优于 MLE 或单目标优化的性能提升?
  • RQ4OCD 能否在无需语言模型重排序的情况下,实现端到端语音识别的最先进结果?

主要发现

  • 在 Wall Street Journal 数据集上,OCD 实现 9.3% 的词错误率(WER),优于所有先前工作,相比 MLE 基线相对提升 12%。
  • 在 Librispeech test-clean 上,OCD 实现 4.5% WER,相比 MLE 基线相对提升 21%,并创下新最先进记录。
  • 在更具挑战性的 Librispeech test-other 数据集上,OCD 实现 13.3% WER,优于 Zeyer 等人(2018)的先前最先进结果 15.4%。
  • 在 WSJ 上,OCD 实现 3.1% 字符错误率(CER),相比 MLE 基线相对提升 14%。
  • OCD 优于其他策略(如选择单一最优完成,例如 OCT),证明考虑全部最优完成的益处。
  • 该算法高效且可扩展,无需额外超参数,且从训练初期即优于 MLE。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。