[论文解读] Cross-Modal ASR Post-Processing System for Error Correction and Utterance Rejection
该论文提出了一种基于跨模态多任务学习的自动语音识别(ASR)后处理系统,通过融合语音和文本特征,统一实现错误纠正与语音语句拒绝。该系统联合训练置信度估计器与错误纠正器,仅在每个标记上引入1.7毫秒延迟,便在单说话人和多说话人语音上均实现了超过10%的相对词错误率(CER)降低,其准确率与效率均优于单模态和单任务模型。
Although modern automatic speech recognition (ASR) systems can achieve high performance, they may produce errors that weaken readers' experience and do harm to downstream tasks. To improve the accuracy and reliability of ASR hypotheses, we propose a cross-modal post-processing system for speech recognizers, which 1) fuses acoustic features and textual features from different modalities, 2) joints a confidence estimator and an error corrector in multi-task learning fashion and 3) unifies error correction and utterance rejection modules. Compared with single-modal or single-task models, our proposed system is proved to be more effective and efficient. Experiment result shows that our post-processing system leads to more than 10% relative reduction of character error rate (CER) for both single-speaker and multi-speaker speech on our industrial ASR system, with about 1.7ms latency for each token, which ensures that extra latency introduced by post-processing is acceptable in streaming speech recognition.
研究动机与目标
- 通过开发统一的后处理框架,解决ASR系统中的错误传播问题,提升准确率与可靠性。
- 通过利用语音与文本模态的跨模态特征,增强错误纠正与语句拒绝能力。
- 通过联合优化置信度估计与错误纠正的多任务学习,提升效率与性能。
- 通过最小化计算开销,在保持高准确率的同时降低流式ASR的延迟。
- 探索在共享学习框架中,置信度估计与错误纠正之间的相互促进作用。
提出的方法
- 系统将ASR模型隐藏状态中的语音嵌入与基于BERT的文本特征进行融合。
- 采用多任务学习架构,通过共享编码器表示,联合训练置信度估计器与错误纠正器。
- 引入长度预测器以在纠正过程中调整序列长度,减少插入错误。
- 利用置信度分数过滤低置信度标记并指导纠正过程,仅在消融研究中显式应用过滤。
- 基于置信度分数的正则化损失与来自BERT的知识蒸馏被用于提升训练稳定性和性能。
- 基于置信度分数、重叠概率以及纠正器的Softmax输出执行语句拒绝。
实验结果
研究问题
- RQ1语音与文本特征的跨模态融合是否能同时提升ASR后处理中的错误纠正与置信度估计性能?
- RQ2与单任务或独立模型相比,联合训练错误纠正与置信度估计的多任务学习是否能提升整体性能?
- RQ3将置信度分数作为过滤机制,对纠正准确率与系统效率有何影响?
- RQ4长度预测器在多大程度上减少了错误纠正中的插入错误?
- RQ5从预训练语言模型中进行知识蒸馏是否能进一步提升后处理系统的性能?
主要发现
- 跨模态模型在IDCT数据集上实现了10.6%的CER,其置信度估计AUC达0.906,优于仅使用BERT的文本模型(AUC 0.887),且推理速度提升8.2倍。
- 联合多任务模型将CER降低至10.6%,参数量仅为46.8MB,优于独立模型,并在使用置信度过滤的单纠正器基础上实现0.25的CER改进。
- 长度预测器使CER降低0.25个百分点,主要通过减少插入错误;正则化损失进一步使NCE提升0.15,CER降低0.35。
- 从BERT-base-chinese进行知识蒸馏后,CER降至10.0%,AUC提升至0.912,证明了外部语言知识的有益作用。
- 该系统在单说话人与多说话人语音上均实现了超过10%的相对CER降低,且每个标记仅1.7毫秒延迟,适用于流式应用场景。
- 在联合模型中,置信度过滤仅带来0.05的CER降低,表明纠正器已通过多任务学习隐式利用置信度信号。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。