Skip to main content
QUICK REVIEW

[论文解读] The CUHK-TUDELFT System for The SLT 2021 Children Speech Recognition Challenge

Si Ioi Ng, Wei Liu|arXiv (Cornell University)|Nov 12, 2020
Speech Recognition and Synthesis参考文献 36被引用 4
一句话总结

本论文介绍了香港城市大学-代尔夫特理工大学(CUHK-TUDELFT)在SLT 2021儿童语音识别挑战赛中的系统,采用联合CTC-注意力端到端(E2E)自动语音识别(ASR)框架,结合成人语音的迁移学习、数据增强(速度扰动、SpecAugment、混响响应(RIR)、音量扰动)以及混合语言模型(4-gram与RNN-LM)。该系统在测试集上实现了20.1%的字符错误率(CER),在整体排名中位列第10名,官方评估集上的CER为23.6%。

ABSTRACT

This technical report describes our submission to the 2021 SLT Children Speech Recognition Challenge (CSRC) Track 1. Our approach combines the use of a joint CTC-attention end-to-end (E2E) speech recognition framework, transfer learning, data augmentation and development of various language models. Procedures of data pre-processing, the background and the course of system development are described. The analysis of the experiment results, as well as the comparison between the E2E and DNN-HMM hybrid system are discussed in detail. Our system achieved a character error rate (CER) of 20.1% in our designated test set, and 23.6% in the official evaluation set, which is placed at 10-th overall.

研究动机与目标

  • 开发一种高性能的儿童语音自动语音识别(ASR)系统,以应对数据有限和声学可变性带来的挑战。
  • 探究在数据稀缺条件下,采用联合CTC-注意力训练的端到端(E2E)ASR在儿童语音识别中的有效性。
  • 评估从成人语音数据迁移学习以及多种数据增强技术在提升E2E ASR在儿童语音上性能方面的效果。
  • 比较E2E ASR与传统混合DNN-HMM系统的表现,并评估不同语言模型(LM)集成策略的影响。

提出的方法

  • 采用联合CTC-注意力端到端ASR框架,结合连接时序分类(CTC)与基于注意力的解码方法,实现序列到序列建模。
  • 通过在341小时成人朗读语音(Set A)上进行预训练,再在59小时儿童语音(C1和C2)上微调,实现迁移学习。
  • 数据增强包括三重速度扰动、SpecAugment、混响(RIR)以及音量扰动,以提升鲁棒性并减少过拟合。
  • 使用两种语言模型:4-gram字符级LM与RNN-LM,均用于对E2E ASR的假设结果进行重打分,以提升准确性。
  • 还开发了用于对比的混合DNN-HMM ASR系统,使用相同的数据和语言模型,解码基于HMM状态转移与声学模型。
  • 训练数据按说话人级别划分为81%训练集、9%验证集和10%测试集,分别针对Set A、C1和C2,以确保无数据泄露。

实验结果

研究问题

  • RQ1从成人语音迁移学习是否能显著提升在有限儿童语音数据上的端到端ASR性能?
  • RQ2各种数据增强技术(如速度扰动、SpecAugment、RIR)在减少过拟合并提升儿童语音ASR泛化能力方面的有效性如何?
  • RQ3结合多种语言模型(如4-gram与RNN-LM)是否能在E2E ASR中带来可测量的性能提升?
  • RQ4在识别儿童语音,尤其是对话场景下,E2E ASR系统与传统混合DNN-HMM系统相比表现如何?

主要发现

  • 基于迁移学习的E2E ASR系统在C1和C2的联合测试集上实现了20.1%的字符错误率(CER),为所有E2E系统中的最佳表现。
  • 在速度扰动基础上增加额外的数据增强(SpecAugment、RIR、音量扰动)使E2E系统的CER从23.6%降低至21.2%,显示出显著改进。
  • 通过融合4-gram LM与RNN-LM对E2E系统进行重打分,将CER降低至20.1%,但需仔细调整语言模型与解码器权重,以避免性能下降。
  • 混合DNN-HMM系统在使用RNN-LM重打分后,CER为20.1%,与最佳E2E系统表现相当,表明混合模型具有很强的竞争力。
  • '仅使用成人语音'的E2E系统在C1上达到12.4% CER,但在C2上高达56.0%,凸显了识别对话式儿童语音相较于朗读语音的挑战。
  • '仅使用儿童语音'的系统在C1与C2联合测试中表现优于'仅使用成人语音'系统,但在C1单独测试中表现较差,表明成人数据有助于朗读语音识别,而儿童数据对对话风格识别至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。