[论文解读] Low Latency ASR for Simultaneous Speech Translation
本文提出了一种低延迟自动语音识别(ASR)系统,用于同步语音翻译,采用持续解码结合稳定的部分假设追踪与动态输出修订机制。通过测量词级延迟而非承诺延迟,系统将平均词延迟从18.1秒降低至1.1秒,同时保持词错误率(WER)不变,显著提升了与现场讲座的实时同步性。
User studies have shown that reducing the latency of our simultaneous lecture translation system should be the most important goal. We therefore have worked on several techniques for reducing the latency for both components, the automatic speech recognition and the speech translation module. Since the commonly used commitment latency is not appropriate in our case of continuous stream decoding, we focused on word latency. We used it to analyze the performance of our current system and to identify opportunities for improvements. In order to minimize the latency we combined run-on decoding with a technique for identifying stable partial hypotheses when stream decoding and a protocol for dynamic output update that allows to revise the most recent parts of the transcription. This combination reduces the latency at word level, where the words are final and will never be updated again in the future, from 18.1s to 1.1s without sacrificing performance in terms of word error rate.
研究动机与目标
- 解决实时同步讲座翻译系统中对低延迟语音识别的迫切需求。
- 通过引入词级延迟,提出一种比承诺延迟更准确的延迟度量指标,用于连续流式解码。
- 在不降低识别准确率的前提下降低延迟,尤其适用于实时、非分段语音输入场景。
- 实现实时输出转录与翻译,使其与讲师手势和幻灯片同步。
提出的方法
- 采用持续解码结合增量假设追踪,尽可能早地输出稳定的部分假设。
- 引入一种动态输出更新协议,使系统在出现更可能的序列时能够修订先前输出的词。
- 在词级测量延迟,定义为从语音输入到最终不可更改输出的时间,以更准确反映用户感知的延迟。
- 使用深度神经网络(DNN)声学模型,搭配4-gram语言模型(150,000多个词)和1,600个神经元的隐藏层,以在低延迟约束下实现稳健识别。
- 应用长度限制技术,在保持高准确率的同时控制峰值延迟,尤其在困难音频段表现更优。
- 在IWSLT 2015的8场TED演讲上评估系统,测量所有系统的词错误率(WER)、实时因子(RTF)、承诺延迟和词延迟。
实验结果
研究问题
- RQ1词级延迟如何作为连续实时语音识别中感知延迟的更准确度量,优于承诺延迟?
- RQ2哪些技术可在不降低识别准确率的前提下减少同步语音翻译中的词级延迟?
- RQ3当系统后续可纠正早期输出时,动态输出修订如何改善延迟表现?
- RQ4长度限制策略对困难音频段中峰值延迟与识别性能有何影响?
主要发现
- 所提系统将平均词延迟从18.1秒降低至1.1秒,改善率达94%,且未造成词错误率(WER)下降。
- 在最佳配置(Update)下,系统最大词延迟仅为9.0秒,而基线系统(Update-NA)为23.5秒。
- Portion与Update系统在词延迟方面显著优于Baseline-1与Baseline-2,尽管其WER与RTF相近,表明承诺延迟与RTF作为延迟度量指标存在不足。
- 对假设稳定化施加3秒长度限制,在保持高准确率的同时有效降低峰值延迟,表明峰值延迟可被最小性能损失控制。
- 动态输出更新机制使系统能早期输出可能稳定的文本,后续可被修订,当初始输出正确时可有效降低延迟。
- 结果证实,在连续非分段输入场景下,词级延迟是评估实时语音识别系统比承诺延迟或RTF更具意义的度量指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。