[论文解读] FunASR: A Fundamental End-to-End Speech Recognition Toolkit
FunASR 是一个开源的端到端自动语音识别工具包,通过提供高精度、大规模预训练模型(尤其是基于60,000小时普通话语音训练的非自回归模型Paraformer)以及优化的推理管道、VAD和标点符号恢复模型,弥合了学术研究与工业部署之间的差距。其在AISHELL数据集上实现1.95%的CER,推理速度比自回归模型快12倍,支持在CPU和GPU平台上高效、高精度部署。
This paper introduces FunASR, an open-source speech recognition toolkit designed to bridge the gap between academic research and industrial applications. FunASR offers models trained on large-scale industrial corpora and the ability to deploy them in applications. The toolkit's flagship model, Paraformer, is a non-autoregressive end-to-end speech recognition model that has been trained on a manually annotated Mandarin speech recognition dataset that contains 60,000 hours of speech. To improve the performance of Paraformer, we have added timestamp prediction and hotword customization capabilities to the standard Paraformer backbone. In addition, to facilitate model deployment, we have open-sourced a voice activity detection model based on the Feedforward Sequential Memory Network (FSMN-VAD) and a text post-processing punctuation model based on the controllable time-delay Transformer (CT-Transformer), both of which were trained on industrial corpora. These functional modules provide a solid foundation for building high-precision long audio speech recognition services. Compared to other models trained on open datasets, Paraformer demonstrates superior performance.
研究动机与目标
- 弥合端到端语音识别领域中学术研究与工业部署之间的差距。
- 提供基于工业语料训练的高精度、大规模预训练模型,尤其针对普通话。
- 通过优化的推理后端(ONNX、TensorRT、libtorch)和量化技术,实现在真实场景中的高效部署。
- 通过在小规模、领域特定数据上轻松微调,支持领域自适应。
- 集成VAD和标点符号恢复等辅助模块,实现完整ASR流水线的部署。
提出的方法
- 核心模型Paraformer是一个在60,000小时人工转录的普通话语音上训练的非自回归端到端ASR模型。
- 在Paraformer主干网络中引入时间戳预测和关键词定制功能,以提升特定术语识别的准确率和时间对齐能力。
- 开源了基于FSMN-VAD的语音活动检测(VAD)模型,该模型在工业数据上进行训练,具备强大的语音检测能力。
- 提供基于CT-Transformer的文本后处理模型,用于标点符号预测和话语冗余纠正。
- 该工具包支持基于recipe的PyTorch训练流程,支持从零开始训练和微调,涵盖AISHELL、LibriSpeech和WenetSpeech数据集。
- 通过AMP量化和多种后端(ONNX、libtorch、TensorRT)实现推理加速,支持CPU和GPU部署。
实验结果
研究问题
- RQ1在大规模工业语音数据上训练的非自回归端到端模型是否能在普通话ASR基准上超越现有模型?
- RQ2在小规模、领域特定数据上微调大规模预训练模型,是否能有效提升识别准确率和关键词召回率?
- RQ3VAD和标点符号恢复等辅助模块是否能显著提升端到端ASR系统在真实应用中的鲁棒性和可用性?
- RQ4在真实部署场景中,与自回归模型相比,Paraformer等非自回归模型的推理效率提升程度如何?
- RQ5自动混合精度(AMP)量化在不降低识别准确率的前提下,能否显著提升推理速度?
主要发现
- Paraformer-large在AISHELL测试集上实现1.95%的CER,优于Conformer,证明了大规模工业训练数据的优势。
- 在V100 GPU上,Paraformer的推理速度相比自回归模型提升12倍,RTF从0.1026降至0.0446(INT8量化下)。
- 在200小时领域特定数据(物流)上微调后,CER从13.1%降至12.6%,长文本测试集上的领域关键词召回率从74.0%提升至96.0%。
- CT-Transformer模型在标点符号和话语冗余纠正任务上取得具有竞争力的F1分数(70.5),且推理速度比完整Transformer基线快1.9倍。
- AMP量化使推理时间减少40%(RTF从0.1026降至0.0446),且未造成准确率损失,支持高效的CPU部署。
- 通过ONNX、libtorch和TensorRT后端,该工具包实现了在CPU、GPU和移动平台上的高精度、低延迟部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。