[论文解读] Low Latency End-to-End Streaming Speech Recognition with a Scout Network
该论文提出了一种低延迟端到端流式语音识别系统,采用侦察网络(SN)实时检测词边界,使识别网络(RN)能够动态调整其前瞻窗口。通过利用SN的边界预测,模型在LibriSpeech数据集上仅实现639毫秒的帧级延迟,便达到了2.7%(test-clean)和6.4%(test-other)的最先进词错误率(WER),显著降低了延迟,同时保持了高精度。
The attention-based Transformer model has achieved promising results for speech recognition (SR) in the offline mode. However, in the streaming mode, the Transformer model usually incurs significant latency to maintain its recognition accuracy when applying a fixed-length look-ahead window in each encoder layer. In this paper, we propose a novel low-latency streaming approach for Transformer models, which consists of a scout network and a recognition network. The scout network detects the whole word boundary without seeing any future frames, while the recognition network predicts the next subword by utilizing the information from all the frames before the predicted boundary. Our model achieves the best performance (2.7/6.4 WER) with only 639 ms latency on the test-clean and test-other data sets of Librispeech.
研究动机与目标
- 解决依赖固定前瞻窗口的流式Transformer ASR模型延迟过高的问题。
- 通过基于实际词边界的动态上下文窗口调整,提升流式设置下的识别准确率。
- 通过可学习的边界检测机制,实现延迟与词错误率(WER)之间的灵活权衡。
- 降低固定块或固定窗口流式方法带来的计算与架构开销。
提出的方法
- 引入侦察网络(SN),在无未来上下文的情况下执行帧级边界分类(词开始/结束),确保零延迟开销。
- 将SN作为序列标注任务进行训练,使用强制对齐作为真实标签,并通过阈值决策定义词段。
- 利用SN预测的词边界引导识别网络(RN),RN据此应用动态自适应前瞻窗口,最多延伸至检测到的边界。
- 采用基于触发注意力(TA)的Transformer模型作为RN,实现帧同步的一次性解码,上下文限制在预测的词边界内。
- 对SN输出概率施加阈值,以控制精确率/召回率的权衡,实现延迟-WER的调优。
- 基于预测词边界与黄金词边界之间的差异,计算帧级和词级延迟指标。

实验结果
研究问题
- RQ1神经边界检测组件是否能在不牺牲识别准确率的前提下降低流式端到端ASR的延迟?
- RQ2与固定窗口或分块方法相比,动态边界感知前瞻在延迟和WER方面表现如何?
- RQ3词边界检测的精确度在多大程度上影响最终识别性能?
- RQ4黄金词边界是否能在流式设置中超越甚至优于离线模型?
主要发现
- 所提方法在LibriSpeech test-clean上实现2.7%的SOTA WER,在test-other上为6.4%,帧级延迟仅639毫秒。
- 使用较高的SN阈值(σ=0.9)可将WER降低至2.9%(clean)和7.4%(other),同时保持619毫秒的低延迟,优于具有2190毫秒延迟的固定窗口TA基线模型。
- 采用黄金词边界的模型实现2.1%和5.3%的WER,超越了离线模型,证明了准确边界信息的价值。
- 更高的SN阈值提升了边界检测的精确度(降低召回率),从而降低WER,证实了更优的边界检测可提升识别质量。
- 参数量达138M的大模型实现2.7%和6.4%的WER,创下LibriSpeech上流式端到端ASR的新SOTA记录。
- 平均词级延迟为352毫秒,表明系统响应迅速,适用于实时应用场景。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。