Skip to main content
QUICK REVIEW

[论文解读] Comprehending Real Numbers: Development of Bengali Real Number Speech Corpus

Md Mahadi Hasan Nahid, Md. Ashraful Islam|arXiv (Cornell University)|Mar 27, 2018
Speech Recognition and Synthesis参考文献 5被引用 4
一句话总结

本论文介绍了首个全面的孟加拉语实数语音语料库,包含来自10名男性说话人的2,302个音频样本,总时长达3.79小时,涵盖所有可能的孟加拉语实数词汇和短语。该语料库可用于训练和评估孟加拉语自动语音识别(ASR)系统,使用CMU Sphinx4模型达到15%的词错误率,使用基于LSTM的识别器达到13.2%,凸显了在低资源语言中构建平衡且多样化的语料库的重要性。

ABSTRACT

Speech recognition has received a less attention in Bengali literature due to the lack of a comprehensive dataset. In this paper, we describe the development process of the first comprehensive Bengali speech dataset on real numbers. It comprehends all the possible words that may arise in uttering any Bengali real number. The corpus has ten speakers from the different regions of Bengali native people. It comprises of more than two thousands of speech samples in a total duration of closed to four hours. We also provide a deep analysis of our corpus, highlight some of the notable features of it, and finally evaluate the performances of two of the notable Bengali speech recognizers on it.

研究动机与目标

  • 为解决孟加拉语实数语音数据集不全面的问题,该问题阻碍了自动语音识别(ASR)系统的发展。
  • 创建一个平衡且具代表性的语料库,涵盖所有可能的孟加拉语实数表达,包括0到100的数字以及包含'百'、'千'、'十万'、'亿'和'小数'等多数字结构的表达。
  • 为评估孟加拉语ASR系统提供基准,涵盖基于传统HMM的模型和基于深度学习的模型。
  • 分析语料库的语音和词汇特征,包括音素频率失衡和词长分布。
  • 为未来扩展提供更多样化的说话人和更广泛的语言覆盖奠定基础。

提出的方法

  • 使用结构化算法生成合成语音语句,通过随机组合基础数字词(0–99)、百位数词(100–900)和数量级术语(千、十万、亿、小数)构成。
  • 确保115个词汇项在语料库中频率分布均衡,以支持模型的均衡训练,但由于缺乏真实数据,未对先验概率进行建模。
  • 从10名母语为孟加拉语的说话人(年龄20–23岁)中收集语音样本,覆盖不同地区,以.wav格式存储,每个样本配有唯一标识符和对应转录文本,保存在text-data.txt中。
  • 将语料库按说话人分目录组织,并采用标准化命名方式(如speaker_5_21.wav),以确保可复现性和数据管理。
  • 应用两种不同的ASR模型:基于HMM的CMU Sphinx4和带有后处理的双向LSTM模型,均通过词错误率和音素错误率进行评估。
  • 在不同训练时长下进行错误率分析,并在训练集和保留的20%测试集(80:20划分)上评估性能。

实验结果

研究问题

  • RQ1如何系统性地构建一个全面且平衡的孟加拉语实数语音语料库,以覆盖该语言中所有可能的数字表达?
  • RQ2孟加拉语实数语音的关键语音和词汇特征是什么,包括音素频率失衡和词长分布?
  • RQ3传统HMM-based与现代深度学习-based ASR模型在该新构建的孟加拉语语音语料库上的表现如何?
  • RQ4训练数据量在多大程度上影响孟加拉语ASR系统中的词错误率,特别是针对数字识别任务?
  • RQ5当前语料库在说话人多样性与语音覆盖方面存在哪些局限性,未来工作应如何改进?

主要发现

  • 语料库包含2,302个语音样本,共17,582个总词,总时长约3.79小时,涵盖115个独特词汇项,覆盖孟加拉语中所有实数表达形式。
  • 语料库包含102个基础数字词(0–100)和13个特殊术语(如'হাজার'表示千,'কোটি'表示亿),其中45个词存在两种可能的发音。
  • CMU Sphinx4模型在保留的20%测试集上达到15%的词错误率,表明其在新语料库上的基线性能表现。
  • 双向LSTM模型达到13.2%的词错误率和29%的音素错误率,且性能随时间推移因后处理而提升。
  • 观察到显著的音素频率失衡现象——例如,'A'的归一化频率为10.8%,而'AI'仅为0.15%,表明语言中存在固有的语音差异。
  • 语料库缺乏女性说话人且年龄多样性有限,提示未来需扩展以提升模型泛化能力与代表性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。