[论文解读] FastEmit: Low-latency Streaming ASR with Sequence-level Emission Regularization
FastEmit 是一种用于流式端到端自动语音识别(ASR)的序列级发射正则化方法,通过直接优化流形-反向传播概率来减少延迟,而无需依赖词级对齐。该方法在 LibriSpeech 数据集上将延迟降低了 150–300ms,同时将词错误率(WER)从 4.4%/8.9% 降低至 3.1%/7.5%,且仅需极少的超参数调优,训练和推理过程无额外计算开销。
Streaming automatic speech recognition (ASR) aims to emit each hypothesized word as quickly and accurately as possible. However, emitting fast without degrading quality, as measured by word error rate (WER), is highly challenging. Existing approaches including Early and Late Penalties and Constrained Alignments penalize emission delay by manipulating per-token or per-frame probability prediction in sequence transducer models. While being successful in reducing delay, these approaches suffer from significant accuracy regression and also require additional word alignment information from an existing model. In this work, we propose a sequence-level emission regularization method, named FastEmit, that applies latency regularization directly on per-sequence probability in training transducer models, and does not require any alignment. We demonstrate that FastEmit is more suitable to the sequence-level optimization of transducer models for streaming ASR by applying it on various end-to-end streaming ASR networks including RNN-Transducer, Transformer-Transducer, ConvNet-Transducer and Conformer-Transducer. We achieve 150-300 ms latency reduction with significantly better accuracy over previous techniques on a Voice Search test set. FastEmit also improves streaming ASR accuracy from 4.4%/8.9% to 3.1%/7.5% WER, meanwhile reduces 90th percentile latency from 210 ms to only 30 ms on LibriSpeech.
研究动机与目标
- 解决尽管在流式端到端 ASR 模型中进行了准确的流形训练,但发射延迟仍然较高的挑战。
- 克服现有方法(如 Early/Late Penalties 和 Constrained Alignments)中因逐 token 或逐帧发射惩罚导致的准确率下降问题。
- 开发一种在序列级别运行的正则化方法,与流形优化对齐,以在不牺牲准确率的前提下改善延迟。
- 实现跨多种流式 ASR 架构(包括 RNN-T、Transformer-T、ConvNet-T 和 Conformer-T)的即插即用式集成。
- 在仅需极少超参数调优且训练或推理阶段无额外计算成本的前提下,实现低延迟推理。
提出的方法
- 引入一种序列级正则化损失,通过修改流形-反向传播算法,抑制整个序列中空白标记(blank token)的发射。
- 应用一个与格网中非空白标记负对数概率成比例的正则化项,以鼓励目标词更早发射。
- 使用单个超参数 λ 将标准流形损失与发射正则化损失进行平衡。
- 使用组合损失端到端训练模型,其中正则化项直接作用于序列级概率分布。
- 通过避免对外部词级对齐或预训练模型的依赖,确保与任何基于流形的模型兼容。
- 仅需极少的超参数调优——仅调整 λ——从而可在不同模型和数据集上实现轻松部署。

实验结果
研究问题
- RQ1序列级发射正则化是否能在不降低识别准确率的前提下减少流式 ASR 的延迟?
- RQ2与 Early/Late Penalties 和 Constrained Alignments 等逐 token 或逐帧正则化方法相比,FastEmit 在 WER 和延迟方面的表现如何?
- RQ3FastEmit 是否能在 RNN-T、Transformer-T、ConvNet-T 和 Conformer-T 等多种流式 ASR 架构上实现良好泛化?
- RQ4使用超参数 λ 时,延迟降低与准确率保持之间的最优平衡点是什么?
- RQ5FastEmit 是否可无需词级对齐数据或额外训练/推理成本而应用?
主要发现
- 在 LibriSpeech 数据集上,FastEmit 将 90% 分位数延迟从 210ms 降低至 30ms,同时将测试集 clean 的 WER 从 4.4% 降低至 3.1%,test-other 集的 WER 从 8.9% 降低至 7.5%。
- 在语音搜索测试集上,FastEmit 在 RNN-T、Transformer-T 和 Conformer-T 模型上均实现了 150–300ms 的延迟降低,在 WER-延迟权衡上优于 CA 和 MaskFrame 基线方法。
- 该方法通过减少删除错误,提升了 LibriSpeech 上的识别准确率,可能归因于缓解了长序列流形过程中的梯度消失问题。
- 超参数调优表明,ContextNet 的最优 λ 为 0.01,Conformer 的最优 λ 为 0.004;进一步提高 λ 值会导致 WER 下降。
- FastEmit 在多种架构上均表现出良好泛化能力,包括 RNN-Transducer、Transformer-Transducer、ConvNet-Transducer 和 Conformer-Transducer。
- 该方法无需外部对齐数据,且不增加训练或推理阶段的计算成本,因此在生产环境中具有高度可部署性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。