[论文解读] Automatic Speech Recognition for Speech Assessment of Persian Preschool Children
本文提出了一种新颖的预训练目标——随机频率音高(RFP),用于Wav2Vec 2.0模型,以提升波斯语学龄前儿童的自动语音识别(ASR)性能,解决因频谱和时间域可变性导致的儿童语音识别挑战。RFP在儿童语音评估任务中表现更优,在无意义词(MW)和快速自动命名(RAN)测试中实现了1.35的词错误率(WER),并在零样本和少样本场景下优于标准掩码方法。
Preschool evaluation is crucial because it gives teachers and parents influential knowledge about children's growth and development. The COVID-19 pandemic has highlighted the necessity of online assessment for preschool children. One of the areas that should be tested is their ability to speak. Employing an Automatic Speech Recognition (ASR) system would not help since they are pre-trained on voices that differ from children's in terms of frequency and amplitude. Because most of these are pre-trained with data in a specific range of amplitude, their objectives do not make them ready for voices in different amplitudes. To overcome this issue, we added a new objective to the masking objective of the Wav2Vec 2.0 model called Random Frequency Pitch (RFP). In addition, we used our newly introduced dataset to fine-tune our model for Meaningless Words (MW) and Rapid Automatic Naming (RAN) tests. Using masking in concatenation with RFP outperforms the masking objective of Wav2Vec 2.0 by reaching a Word Error Rate (WER) of 1.35. Our new approach reaches a WER of 6.45 on the Persian section of the CommonVoice dataset. Furthermore, our novel methodology produces positive outcomes in zero- and few-shot scenarios.
研究动机与目标
- 解决由于儿童语音与成人语音在声学特性上的差异,导致波斯语学龄前儿童语音ASR准确率低的问题。
- 克服标准Wav2Vec 2.0预训练目标的局限性,这些目标未针对儿童语音特征(如更高的共振峰和更宽的频带范围)进行优化。
- 开发一种针对学龄前儿童认知评估的领域自适应ASR系统,特别针对快速自动命名(RAN)和无意义词(MW)测试。
- 提升波斯语低资源儿童语音识别在零样本和少样本设置下的泛化性能。
- 构建并发布一个新的波斯语儿童语音数据集,用于在发展评估背景下对ASR模型进行微调和评估。
提出的方法
- 提出一种新的预训练目标——随机频率音高(RFP),在自监督预训练过程中对掩码音频片段应用随机音高偏移,以增强在不同频带范围内的鲁棒性。
- 在CommonVoice数据集中的波斯语语音数据以及新收集的儿童语音数据上,对RFP增强的Wav2Vec 2.0模型进行微调,用于RAN和MW任务。
- 采用修改后的Wav2Vec 2.0架构,包含12个Transformer块、d_model = 768、d_ff = 3072和8个注意力头,使用960小时未配文本的LibriSpeech-960英语数据进行训练。
- 在预训练过程中使用温度从2衰减至0.5的Gumbel-Softmax,以及温度κ = 0.1的对比损失。
- 使用Google Colab TPU(v2-8)训练模型,批量大小为64,下游任务微调步数为50k。
- 通过在未微调的预训练模型上直接测试波斯语CommonVoice数据集来评估零样本性能,通过在15小时数据上微调来评估少样本性能。
实验结果
研究问题
- RQ1修改后的预训练目标是否能提升Wav2Vec 2.0在波斯语儿童语音上的表现,特别是在低资源和零样本设置下?
- RQ2在RAN和MW等儿童语音评估任务中,随机频率音高(RFP)与标准掩码方法相比,WER表现如何?
- RQ3RFP在波斯语ASR的零样本和少样本场景下,对模型泛化能力的提升程度如何?
- RQ4通过RFP实现的频域适应是否能缓解因儿童更高的共振峰和更宽的频谱可变性导致的性能下降?
- RQ5能否在无需大规模儿童语音转录数据的情况下,通过RFP有效将基于成人语音预训练的自监督模型适配至儿童语音?
主要发现
- RFP预训练目标在无意义词(MW)和快速自动命名(RAN)测试中实现了1.35的词错误率(WER),显著优于标准掩码方法。
- 在CommonVoice数据集的波斯语部分,RFP模型实现了6.45的WER,表明其在波斯语儿童语音识别任务中达到最先进水平。
- 在零样本评估中,RFP模型实现了30.48的WER,优于掩码基线模型(42.30),表明其领域泛化能力更强。
- 在少样本场景下,仅用15小时CommonVoice数据微调RFP模型,50k步后WER达到10.42,优于掩码基线模型(12.50)。
- 在LibriSpeech-960上的预训练过程中,RFP模型收敛更快且WER更低,如图6所示。
- RFP与掩码方法的结合提升了模型对新环境的适应能力,使其在不同频带范围和低资源设置下均表现有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。