[论文解读] OC16-CE80: A Chinese-English Mixlingual Database and A Speech Recognition Baseline
本论文提出 OC16-CE80,一个包含超过1,400名说话人的80小时中文-英文混合语言语音数据库,专为 MixASR-CHEN 2016 挑战赛设计。采用基于 THCHS30 和 OC16-CE80 训练的语言模型的 DNN-HMM 混合系统作为基线,整体词错误率(WER)达到 20.09%,尽管由于语音和语言模型中语言间的竞争,英文词错误率较高,但该数据库在多语言自动语音识别研究中的可行性已得到验证。
We present the OC16-CE80 Chinese-English mixlingual speech database which was released as a main resource for training, development and test for the Chinese-English mixlingual speech recognition (MixASR-CHEN) challenge on O-COCOSDA 2016. This database consists of 80 hours of speech signals recorded from more than 1,400 speakers, where the utterances are in Chinese but each involves one or several English words. Based on the database and another two free data resources (THCHS30 and the CMU dictionary), a speech recognition (ASR) baseline was constructed with the deep neural network-hidden Markov model (DNN-HMM) hybrid system. We then report the baseline results following the MixASR-CHEN evaluation rules and demonstrate that OC16-CE80 is a reasonable data resource for mixlingual research.
研究动机与目标
- 开发一个公开可用的大规模中文-英文混合语言语音数据库,以支持代码切换语音识别研究。
- 通过提供一个标准化基准,解决低资源多语言自动语音识别的挑战,用于评估系统在代码切换语音样本上的表现。
- 基于 OC16-CE80 数据库及补充数据集(THCHS30、CMU 字典)建立一个自动语音识别基线系统,为 MixASR-CHEN 2016 挑战赛的参与者提供指导。
- 分析在中文语句中识别嵌入英文词的困难,特别是由于语音和语言模型在两种语言间的竞争。
提出的方法
- OC16-CE80 数据库通过 1,400 多名说话人使用手机采集,包含 80 小时的语音,采样率为 16 kHz,量化精度为 16 位,文本转录采用朗读风格。
- 数据库被划分为训练集(63.8 小时,1,163 名说话人)、开发集(7.76 小时,140 名说话人)和测试集(7.93 小时,142 名说话人),所有语句均以中文为句式主干并嵌入英文单词。
- 基于 THCHS30 中文语料和 OC16-CE80 数据库构建 DNN-HMM 混合自动语音识别系统,词典源自 CMU 字典和 OC16-CE80 的转录文本。
- 训练了四种语言模型:THLM(基于 THCHS30)、OCLM(基于 OC16-CE80)、MIX(THLM 与 OCLM 的线性插值)以及 JOIN(在两个数据集上联合训练),插值权重在 2,000 个句子的验证集上进行优化。
- 系统采用语言模型权重与词插入惩罚的线性插值,以平衡中文和英文词的识别性能。
- 对 MIX 语言模型配置进行了错误分析,以识别替换、删除和插入错误,特别关注英文词错误率显著偏高的问题。
实验结果
研究问题
- RQ1OC16-CE80 数据库在中文-英文代码切换语音识别的训练与评估中效果如何?
- RQ2在中文语句中识别嵌入英文词的主要语音与语言学挑战是什么?
- RQ3当使用 THCHS30 等外部语料时,语言模型领域不匹配在混合语言自动语音识别中在多大程度上影响性能?
- RQ4中文与英文语言模型及语音模型之间的竞争在多大程度上影响词错误率,特别是对英文词的影响?
- RQ5仅使用公开资源时,标准 DNN-HMM 系统能否在混合语言数据上实现合理性能?
主要发现
- 基线系统在测试集上使用 MIX 语言模型时,整体词错误率(WER)达到 20.09%。
- 仅在 OC16-CE80 上训练的 OCLM 语言模型在中文词上达到 19.00% 的 WER,在英文词上达到 43.67% 的 WER,优于在单语中文语料上训练的 THLM 模型(英文词 WER 为 100%)。
- 在单语中文语料上训练的 THLM 模型在英文词上表现极差,表明存在显著的领域不匹配,且对代码切换数据的泛化能力差。
- 英文词的替换与删除错误显著高于中文词,其中英文词的总错误中 22.11% 为替换错误。
- 英文词错误率高的主要原因在于英文音素的语音建模能力弱,以及语言模型概率低,特别是涉及英文词的转移概率,导致解码时更倾向于生成纯中文序列。
- 错误分析显示,许多英文词的错误替换是由于与中文词的语音相似性所致,表明语言间的语音混淆是混合语言自动语音识别中的主要挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。