Skip to main content
QUICK REVIEW

[论文解读] Applying wav2vec2 for Speech Recognition on Bengali Common Voices Dataset

H. A. Z. Sameen Shahgir, Khondker Salman Sayeed|arXiv (Cornell University)|Sep 11, 2022
Speech Recognition and Synthesis被引用 5
一句话总结

本文在精选的孟加拉语 Common Voice 数据集子集上微调 Facebook 的 wav2vec2.0-large-xlsr-53,以提升低资源孟加拉语的语音识别性能。通过在 37,500 个高质量、获赞数高于反对数的音频样本上进行训练,并在后续与验证数据合并,该模型在测试数据上实现了 0.2524 的词错误率(WER)和 2.6075 的莱文施泰因距离,优于隐藏测试集上的其他提交结果。

ABSTRACT

Speech is inherently continuous, where discrete words, phonemes and other units are not clearly segmented, and so speech recognition has been an active research problem for decades. In this work we have fine-tuned wav2vec 2.0 to recognize and transcribe Bengali speech -- training it on the Bengali Common Voice Speech Dataset. After training for 71 epochs, on a training set consisting of 36919 mp3 files, we achieved a training loss of 0.3172 and WER of 0.2524 on a validation set of size 7,747. Using a 5-gram language model, the Levenshtein Distance was 2.6446 on a test set of size 7,747. Then the training set and validation set were combined, shuffled and split into 85-15 ratio. Training for 7 more epochs on this combined dataset yielded an improved Levenshtein Distance of 2.60753 on the test set. Our model was the best performing one, achieving a Levenshtein Distance of 6.234 on a hidden dataset, which was 1.1049 units lower than other competing submissions.

研究动机与目标

  • 提升孟加拉语语音识别性能,该语言为低资源语言,且转录数据有限。
  • 探究在低资源语言(如孟加拉语)上,使用多语言 wav2vec2.0 进行自监督预训练的有效性。
  • 评估通过点赞/反对票指标进行数据质量过滤对模型性能的影响。
  • 探索通过分阶段训练逐步增加数据规模的增量数据暴露带来的优势。
  • 证明微调多语言预训练模型可在仅使用少量标注数据的情况下,为孟加拉语自动语音识别任务取得最先进性能。

提出的方法

  • 在精选的孟加拉语 Common Voice 数据集子集上微调自监督的 wav2vec2.0-large-xlsr-53 模型,仅选择点赞数高于反对票数的样本。
  • 通过将音频文件重采样至 16kHz 并将转录文本分词为字符以作为模型输入,对音频文件进行预处理。
  • 将训练分为两个阶段:首先在 37,500 个训练样本上训练,然后在重新洗牌后的 45,000 个样本数据集(训练集+验证集)上重新训练。
  • 在推理阶段应用 5-gram 语言模型,以提升测试集上的莱文施泰因距离表现。
  • 在微调过程中使用连接时序分类(CTC)损失,以对齐预测转录与真实转录。
  • 使用词错误率(WER)和莱文施泰因距离在独立测试集上评估性能。

实验结果

研究问题

  • RQ1在标注数据有限的情况下,多语言自监督的 wav2vec2.0 模型能否在孟加拉语语音识别任务上取得优异性能?
  • RQ2使用点赞/反对票指标对训练数据进行过滤,是否能提升低资源语音识别任务的模型性能?
  • RQ3在训练过程中逐步暴露更大规模的合并数据集,是否能提升模型在未见测试数据上的泛化能力?
  • RQ4当在 Common Voice 数据集的精选子集上微调时,wav2vec2.0 在孟加拉语上的性能与其它模型相比如何?
  • RQ5在欧洲语言上进行预训练,对非欧洲低资源语言(如孟加拉语)的性能影响有多大?

主要发现

  • 在 7,747 个样本的验证集上训练 71 个周期后,模型的训练损失为 0.3172,词错误率(WER)为 0.2524。
  • 在将数据合并并重新在更大的 45,000 个样本数据集上训练后,测试集上的莱文施泰因距离从 2.6446 降低至 2.60753。
  • 在隐藏测试集上,模型的莱文施泰因距离为 6.234,比其他竞争提交结果低 1.1049 个单位。
  • 模型表现稳定,未出现显著过拟合现象,即使在损失和 WER 达到平台期后,评估指标仍略有提升。
  • 在推理阶段使用 5-gram 语言模型可降低测试集上的莱文施泰因距离,表明对转录错误具有更强的鲁棒性。
  • 结果表明,若在与孟加拉语相近的语言上进行预训练,性能可能进一步提升,因为当前模型在孟加拉语上的性能仅比先前最先进方法有微小改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。