Skip to main content
QUICK REVIEW

[论文解读] Hindi-English Code-Switching Speech Corpus

Ganji Sreeram, Kunal Dhawan|arXiv (Cornell University)|Sep 24, 2018
Speech Recognition and Synthesis参考文献 15被引用 6
一句话总结

本论文提出了一项大规模印地语-英语(印英混用)代码切换语音语料库,包含来自印度不同地区、性别和年龄群体的71名说话者的7,005条语音片段。该语料库支持自动语音识别(ASR)系统的训练与评估,采用深度神经网络(DNN)声学模型结合三元语法语言模型,实现了25.40%的词错误率(WER),为印度低资源代码切换ASR研究做出了重要贡献。

ABSTRACT

Code-switching refers to the usage of two languages within a sentence or discourse. It is a global phenomenon among multilingual communities and has emerged as an independent area of research. With the increasing demand for the code-switching automatic speech recognition (ASR) systems, the development of a code-switching speech corpus has become highly desirable. However, for training such systems, very limited code-switched resources are available as yet. In this work, we present our first efforts in building a code-switching ASR system in the Indian context. For that purpose, we have created a Hindi-English code-switching speech database. The database not only contains the speech utterances with code-switching properties but also covers the session and the speaker variations like pronunciation, accent, age, gender, etc. This database can be applied in several speech signal processing applications, such as code-switching ASR, language identification, language modeling, speech synthesis etc. This paper mainly presents an analysis of the statistics of the collected code-switching speech corpus. Later, the performance results for the ASR task have been reported for the created database.

研究动机与目标

  • 为解决印度自动语音识别(ASR)领域中大规模、多样化印地语-英语代码切换语音资源匮乏的问题。
  • 构建一个具有代表性的语音语料库,捕捉口音、年龄、性别和地理来源的差异,以提升代码切换ASR系统的鲁棒性。
  • 通过最先进的模型(如DNN和三元语法语言模型)进行基准ASR实验,验证该语料库的有效性。
  • 支持下游应用,如语言识别、语音合成以及多语言印度语境下的语言建模。

提出的方法

  • 从印度21个邦的71名母语为印地语的说话者中收集了7,005条语音片段,确保地理、年龄和性别多样性。
  • 采用结构化数据采集协议,通过现场顾问在受控环境中录制语音,涵盖句内和句间代码切换模式。
  • 使用MFCC特征对音频进行预处理,并应用线性判别分析(LDA)和说话人自适应训练(SAT)变换以改善声学建模。
  • 使用Kaldi工具包训练GMM和基于DNN的声学模型,其中5,500条语音用于训练,1,505条用于测试。
  • 利用IRSTLM工具包基于11,566条训练句构建三元语法语言模型,以增强对代码切换语音的语言理解能力。
  • 通过词错误率(WER)评估性能,比较单语、三音素和深度神经网络(DNN)模型在不同特征集下的表现。

实验结果

研究问题

  • RQ1在印度多语言说话者的自然印地语-英语语音中,代码切换模式(句内 vs. 句间)的分布情况如何?
  • RQ2说话者的人口统计学特征(年龄、性别、地区)的变化如何影响印地语-英语代码切换语音的声学特性?
  • RQ3基于DNN的声学模型在新构建的印地语-英语代码切换语料库上的表现如何,相较于传统的GMM模型?
  • RQ4在代码切换文本上训练的三元语法语言模型在多大程度上能提升该语料库的ASR准确率?

主要发现

  • 该语料库包含来自71名说话者的7,005条语音片段,其中男性44名,女性27名,涵盖21个印度邦,年龄范围为20至64岁。
  • 地理分布显示,东部占40.84%,北部占30.98%,南部占18.33%,西部占9.85%,确保了区域多样性。
  • 采用LDA和SAT特征的DNN声学模型实现了最低的词错误率25.40%,优于GMM基线模型。
  • 表现最佳的模型包含5个隐藏层,每层1,024个神经元,使用tanh激活函数,训练20个周期,小批量大小为128。
  • 基于11,566条句子训练的三元语法语言模型显著提升了识别准确率,凸显了语言建模在代码切换ASR中的重要性。
  • 该语料库仍在持续收集中,表明未来研究将进一步扩展其规模和多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。