[论文解读] Semi-supervised acoustic modelling for five-lingual code-switched ASR using automatically-segmented soap opera speech
本文提出了一种用于五语种代码切换语音的半监督自动语音识别(ASR)系统,利用自动分割的肥皂剧音频,结合基于CNN的语音活动检测(VAD)与GMM-HMM平滑及说话人辨识技术。性能最佳的方法相比人工分割方法实现了1.1%的绝对WER降低,证明自动分割可实现在资源匮乏的多语言环境下的完全可扩展、高性能ASR。
This paper considers the impact of automatic segmentation on the fully-automatic, semi-supervised training of automatic speech recognition (ASR) systems for five-lingual code-switched (CS) speech. Four automatic segmentation techniques were evaluated in terms of the recognition performance of an ASR system trained on the resulting segments in a semi-supervised manner. The system's output was compared with the recognition rates achieved by a semi-supervised system trained on manually assigned segments. Three of the automatic techniques use a newly proposed convolutional neural network (CNN) model for framewise classification, and include a novel form of HMM smoothing of the CNN outputs. Automatic segmentation was applied in combination with automatic speaker diarization. The best-performing segmentation technique was also tested without speaker diarization. An evaluation based on 248 unsegmented soap opera episodes indicated that voice activity detection (VAD) based on a CNN followed by Gaussian mixture modelhidden Markov model smoothing (CNN-GMM-HMM) yields the best ASR performance. The semi-supervised system trained with the resulting segments achieved an overall WER improvement of 1.1% absolute over the system trained with manually created segments. Furthermore, we found that system performance improved even further when the automatic segmentation was used in conjunction with speaker diarization.
研究动机与目标
- 评估自动分割对资源匮乏环境下五语种代码切换语音半监督ASR性能的影响。
- 比较多种自动分割技术(从基于能量的VAD到CNN-HMM及CNN-GMM-HMM)在识别准确率上的表现。
- 评估自动分割结合说话人辨识是否能与人工分割数据的性能相匹配或超越。
- 探究在低资源环境下,实现完全自动、可扩展的ASR训练流程在多语言、代码切换语音中的可行性。
提出的方法
- 评估了四种自动分割技术:(1) 基于能量的VAD与说话人辨识结合,(2) 基于CNN的帧级分类结合HMM平滑与辨识,(3) 基于CNN的GMM-HMM平滑与辨识,(4) 基于CNN的GMM-HMM平滑但不使用辨识。
- 训练了一种新型CNN模型,用于帧级分类语音、音乐和噪声,随后通过HMM平滑优化时间边界。
- 采用X向量DNN嵌入进行说话人辨识,为片段分配说话人身份,提升分割准确率。
- 半监督训练使用强基线系统生成的伪标签,该基线系统在21小时人工转录和11小时人工分割语音上进行训练。
- 最终ASR系统在248段未分割的肥皂剧剧集中进行评估,并与人工分割基线进行性能对比。
- 系统性能通过词错误率(WER)和语言切换点处的代码切换二元语法正确率(Bi CS)进行衡量。
实验结果
研究问题
- RQ1基于CNN的VAD结合GMM-HMM平滑的自动分割能否在五语种代码切换语音中实现与人工分割相当的ASR性能?
- RQ2说话人辨识如何影响自动分割ASR系统的性能?
- RQ3与人工分割相比,使用自动分割的未转录肥皂剧数据进行半监督训练,能否提升WER和代码切换识别准确率?
- RQ4在低资源、多语言代码切换场景中,不同自动分割技术对ASR性能的相对影响如何?
主要发现
- 采用说话人辨识的CNN-GMM-HMM VAD实现了最佳ASR性能,相比人工分割基线,WER绝对降低1.1%。
- 在自动分割数据上训练的系统性能与人工分割数据相当或略有超越,表明自动分割是一种切实可行的替代方案。
- 引入说话人辨识显著提升了识别准确率,尤其在代码切换点处,证实其在多语言环境中的价值。
- 五语种半监督系统(系统I)优于所有双语系统,相比其最接近的竞争对手(系统F)实现0.5%的绝对WER降低,且具有统计显著性。
- 所有半监督系统在语言特定WER和Bi CS得分上均有显著提升,且人工与自动分割数据之间无显著差异。
- 结果证实,结合说话人辨识的自动分割可实现针对资源匮乏、多语言代码切换语音的可扩展、高性能ASR。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。