[论文解读] Improving Performance of End-to-End ASR on Numeric Sequences
该论文通过在语音领域进行训练并使用神经去归一化技术,显著提升了长数字序列的端到端自动语音识别(ASR)性能,最高实现长达8倍的词错误率(WER)降低,方法包括使用合成TTS数据和轻量级神经校正模型,其在设备端部署场景下优于传统的FST基去归一化方法。
Recognizing written domain numeric utterances (e.g. I need $1.25.) can be challenging for ASR systems, particularly when numeric sequences are not seen during training. This out-of-vocabulary (OOV) issue is addressed in conventional ASR systems by training part of the model on spoken domain utterances (e.g. I need one dollar and twenty five cents.), for which numeric sequences are composed of in-vocabulary numbers, and then using an FST verbalizer to denormalize the result. Unfortunately, conventional ASR models are not suitable for the low memory setting of on-device speech recognition. E2E models such as RNN-T are attractive for on-device ASR, as they fold the AM, PM and LM of a conventional model into one neural network. However, in the on-device setting the large memory footprint of an FST denormer makes spoken domain training more difficult. In this paper, we investigate techniques to improve E2E model performance on numeric data. We find that using a text-to-speech system to generate additional numeric training data, as well as using a small-footprint neural network to perform spoken-to-written domain denorming, yields improvement in several numeric classes. In the case of the longest numeric sequences, we see reduction of WER by up to a factor of 8.
研究动机与目标
- 解决端到端ASR在长数字序列(如电话号码、邮政编码和金额)中出现的词汇表外(OOV)问题。
- 克服规则基FST去归一化器在内存受限的设备端应用中的局限性。
- 通过利用合成数据和神经校正模型,以低资源占用、可扩展的方式提升数字ASR性能。
- 评估语音领域训练与神经去归一化结合在长尾数字语音上的有效性。
提出的方法
- 使用文本到语音(TTS)系统生成合成训练数据,以增强书面领域中罕见和长数字序列的覆盖度。
- 在书面领域真实标签与RNN-T假设对上训练神经校正模型(神经去归一化器),以学习纠正格式错误和转录错误。
- 在语音领域(如“four fifteen”而非“4:15”)训练RNN-T模型,以避免推理阶段出现OOV问题。
- 实现一个轻量级神经去归一化器,采用双向GRU编码器和基于注意力的解码器,专为设备端部署的低内存使用而优化。
- 在书面和语音领域训练设置下,将神经去归一化与传统FST基去归一化进行对比。
- 使用不同的TTS系统(WaveNet与拼接式)生成测试集音频,以确保在不同TTS风格下的评估鲁棒性。

实验结果
研究问题
- RQ1使用合成TTS生成的训练数据能否提升罕见和长数字序列的端到端ASR性能?
- RQ2与书面领域训练相比,语音领域训练是否能更有效地缓解数字语音的OOV问题?
- RQ3神经去归一化器在WER降低方面是否优于规则基FST去归一化器,尤其是在长数字序列上?
- RQ4语音领域训练、合成TTS数据与神经去归一化三者结合对不同数字类型ASR性能的综合影响如何?
- RQ5神经去归一化器在真实音频和包含复杂口语化表达的精选测试集上的表现如何?
主要发现
- 语音领域训练、合成TTS数据与神经去归一化器的结合,在精选测试集中使长数字序列的WER最高降低8倍。
- 在语音领域结合神经去归一化(S2)设置下,大数字的WER降低了83%,小数字的WER降低了75%,相比基线模型。
- 当与TTS数据结合时,神经校正模型在大数字上使WER降低49%,在小数字上降低75%,优于书面领域方法。
- 语音领域训练结合神经去归一化几乎完全消除了FST基系统中常见的格式错误与去归一化错误,后者在复杂或罕见数字口语化表达中常出现失败。
- 神经去归一化器在不降低真实音频或通用数字测试集性能的前提下实现了显著的WER降低,证实了其鲁棒性。
- 错误分析显示,书面领域模型常将数字序列的某部分与发音相似的词语混淆(例如,'180.50' → '180 - $50 in inr'),而语音领域模型结合神经去归一化后基本避免了此类错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。