Skip to main content
QUICK REVIEW

[论文解读] Low-Latency Sequence-to-Sequence Speech Recognition and Translation by Partial Hypothesis Selection

Danni Liu, Gerasimos Spanakis|arXiv (Cornell University)|May 22, 2020
Natural Language Processing Techniques参考文献 43被引用 9
一句话总结

本文提出了一种基于部分假设选择、单向编码器和部分序列适应的低延迟端到端语音识别与翻译框架。在How2 ASR数据集上,该方法将延迟降低了83%(0.8秒),WER仅增加1%;在语音翻译任务中,延迟降低84%(0.7秒),相对BLEU损失仅为5%,同时通过选择性输出承诺和高效推理保持了较强的准确性。

ABSTRACT

Encoder-decoder models provide a generic architecture for sequence-to-sequence tasks such as speech recognition and translation. While offline systems are often evaluated on quality metrics like word error rates (WER) and BLEU, latency is also a crucial factor in many practical use-cases. We propose three latency reduction techniques for chunk-based incremental inference and evaluate their efficiency in terms of accuracy-latency trade-off. On the 300-hour How2 dataset, we reduce latency by 83% to 0.8 second by sacrificing 1% WER (6% rel.) compared to offline transcription. Although our experiments use the Transformer, the hypothesis selection strategies are applicable to other encoder-decoder models. To avoid expensive re-computation, we use a unidirectionally-attending encoder. After an adaptation procedure to partial sequences, the unidirectional model performs on-par with the original model. We further show that our approach is also applicable to low-latency speech translation. On How2 English-Portuguese speech translation, we reduce latency to 0.7 second (-84% rel.) while incurring a loss of 2.4 BLEU points (5% rel.) compared to the offline system.

研究动机与目标

  • 解决在线序列到序列模型在语音识别与翻译任务中延迟过高的挑战。
  • 实现单一模型同时支持离线与在线推理,无需重新训练。
  • 在分块增量推理中降低延迟,同时最小化自动语音识别与翻译质量的下降。
  • 探索通过选择性地承诺部分假设来稳定流式推理过程中的预测。
  • 提出一种方法,将预训练的完整序列模型适应于增量推理,性能下降最小。

提出的方法

  • 使用不包含未来上下文的单向编码器,实现无需依赖未来信息的高效增量解码。
  • 通过仅承诺每个分块输出的前缀来实现部分假设选择,减少不稳定预测。
  • 通过hold-n(固定输出速率)和局部一致(基于共识的选择)等策略实现前缀函数。
  • 通过模拟流式输入的微调过程,将预训练模型适应于部分序列。
  • 将解码器条件化在前一帧块的已承诺假设上,实现上下文感知的增量生成。
  • 使用固定分块大小,随着新音频段的到来逐步解码,通过复用解码器状态避免重复计算。

实验结果

研究问题

  • RQ1部分假设选择在流式语音识别与翻译中如何改善延迟-质量权衡?
  • RQ2在完整序列上预训练的单向编码器能否在最小准确率损失下有效适应于增量推理?
  • RQ3哪种假设选择策略(hold-n、局部一致、hold-0)在延迟与质量之间达到最佳平衡?
  • RQ4对部分序列的模型适应在低延迟设置下能在多大程度上提升性能?
  • RQ5所提出的方法能否在不同序列到序列任务(如ASR与语音翻译)中实现泛化?

主要发现

  • 在语音识别任务中,局部一致策略实现了最佳的延迟-质量权衡,将延迟降低至0.8秒,与离线转录相比,WER仅增加1%(相对提升6%)。
  • 经过部分序列适应后,单向模型在How2 ASR数据集上达到14.4% WER,与双向模型性能相当。
  • 适应后,单向模型在离线推理中仍保持14.4% WER,证明其保留了完整序列的性能。
  • 在How2英语-葡萄牙语语音翻译任务中,该方法将延迟降低84%(至0.7秒),相对BLEU损失仅为5%(从44.5降至42.1),与离线系统相比。
  • hold-4与局部一致策略优于hold-0与hold-2,且局部一致策略在保持相近质量的同时实现了比hold-4更低的延迟。
  • 对部分序列的适应在ASR中将错误率降低了最多1%,延迟仅增加最多0.3秒,表明输出控制能力得到提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。