[论文解读] Universal ASR: Unifying Streaming and Non-Streaming ASR Using a Single Encoder-Decoder Model
本文提出Universal ASR,一种统一的端到端模型,通过共享的动态块编码器和双路解码器,将流式与非流式自动语音识别整合到单一架构中。该系统通过在流式路径中实现可配置延迟,在非流式路径中通过联合训练和共享计算提升准确率,实现了AISHELL-2基准测试中5.62%的CER,达到当前最先进水平。
Recently, online end-to-end ASR has gained increasing attention. However, the performance of online systems still lags far behind that of offline systems, with a large gap in quality of recognition. For specific scenarios, we can trade-off between performance and latency, and can train multiple systems with different delays to match the performance and latency requirements of various application scenarios. In this work, in contrast to trading-off between performance and latency, we envisage a single system that can match the needs of different scenarios. We propose a novel architecture, termed Universal ASR that can unify streaming and non-streaming ASR models into one system. The embedded streaming ASR model can configure different delays according to requirements to obtain real-time recognition results, while the non-streaming model is able to refresh the final recognition result for better performance. We have evaluated our approach on the public AISHELL-2 benchmark and an industrial-level 20,000-hour Mandarin speech recognition task. The experimental results show that the Universal ASR provides an efficient mechanism to integrate streaming and non-streaming models that can recognize speech quickly and accurately. On the AISHELL-2 task, Universal ASR comfortably outperforms other state-of-the-art systems.
研究动机与目标
- 通过将流式与非流式端到端ASR系统统一为单一模型,弥合两者之间的性能差距。
- 降低为不同延迟需求维护多个独立模型所带来的运营与优化开销。
- 在流式组件中实现可配置延迟的实时推理,同时通过第二轮非流式优化保持高准确率。
- 通过在线与离线组件共享编码器,最小化计算成本。
- 通过利用来自在线预测的完整上下文表示与语义上下文,提升非流式模式下的识别准确率。
提出的方法
- 提出一种统一的编码器-解码器架构,基于LC-SAN-M的共享动态块编码器,支持流式与非流式推理。
- 采用流式解码器,结合流式块感知多头注意力(SCAMA)与预测器,控制对局部上下文的注意力,确保低延迟推理。
- 引入动态延迟训练(DLT),使单一在线模型可在推理阶段支持多种延迟配置(如300ms、600ms、900ms)。
- 设计非流式组件,包含全序列编码器、用于注入在线模型预测结果的文本编码器,以及用于上下文丰富解码的全序列解码器。
- 在离线路径中使用步长卷积下采样(核大小=5,步长=2),在不损失性能的前提下降低计算成本。
- 端到端联合训练整个模型,实现参数共享及流式与非流式组件的联合优化。
实验结果
研究问题
- RQ1单一端到端ASR模型能否有效统一流式与非流式推理,并实现可配置延迟?
- RQ2在流式与非流式组件之间共享编码器是否能在保持或提升性能的同时降低计算成本?
- RQ3非流式组件能否利用在线组件的预测结果,提升最终识别准确率?
- RQ4动态延迟训练(DLT)在多大程度上提升了模型在不同延迟约束下的灵活性与性能?
- RQ5与独立的流式与非流式模型相比,所提出的统一模型在准确率与推理效率方面表现如何?
主要发现
- Universal ASR在AISHELL-2测试集(test_ios)上实现了5.62%的CER,创下该基准的新SOTA记录。
- Universal ASR的离线组件在通用与远场测试集上,相对于离线基线模型(Model0)实现了超过15%的相对误差降低。
- 采用动态延迟训练(DLT)的在线组件在相同延迟设置下,性能优于单独训练的SCAMA模型。
- 移除全序列编码器会显著降低性能,证实了在非流式解码中完整上下文建模的重要性。
- 离线路径中的文本编码器通过引入在线预测的语义上下文,提升了性能,证明了跨路径知识迁移的价值。
- 共享编码器与步长卷积下采样显著降低了离线路径的计算成本,实现了计算高效的第二轮解码,且延迟可接受。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。