Skip to main content
QUICK REVIEW

[论文解读] Boosting Norwegian Automatic Speech Recognition

Javier de la Rosa, Rolv-Arild Braaten|arXiv (Cornell University)|Jul 4, 2023
Speech Recognition and SynthesisComputer Science被引用 3
一句话总结

本论文提出基于wav2vec 2.0架构的改进型自动语音识别(ASR)模型,用于挪威语书面语(Bokmål)和新挪威语(Nynorsk),并在包括NPSC和NST在内的挪威语语音数据集上进行微调。该模型在Bokmål上实现5.81%的词错误率(WER),在Nynorsk上实现11.54%的WER,创下新SOTA纪录,显著优于先前模型,甚至在域外FLEURS数据上超越了更大的Whisper模型。

ABSTRACT

In this paper, we present several baselines for automatic speech recognition (ASR) models for the two official written languages in Norway: Bokmål and Nynorsk. We compare the performance of models of varying sizes and pre-training approaches on multiple Norwegian speech datasets. Additionally, we measure the performance of these models against previous state-of-the-art ASR models, as well as on out-of-domain datasets. We improve the state of the art on the Norwegian Parliamentary Speech Corpus (NPSC) from a word error rate (WER) of 17.10\% to 7.60\%, with models achieving 5.81\% for Bokmål and 11.54\% for Nynorsk. We also discuss the challenges and potential solutions for further improving ASR models for Norwegian.

研究动机与目标

  • 为挪威语Bokmål和Nynorsk(两种具有显著形态与语音特征差异的官方书面语)开发稳健的ASR基线模型。
  • 评估结合多样化语音数据集(特别是计划性语音NST与半即兴语音NPSC)对ASR性能的影响。
  • 通过利用更大、更多样化的训练数据,在未脚本化的议会语音上超越先前SOTA,提升挪威语ASR性能。
  • 评估模型在域外数据集(如FLEURS)上的泛化性能,以衡量其在域内测试集之外的鲁棒性。

提出的方法

  • 在挪威语语音数据集(包括挪威议会语音语料库NPSC和北欧语言技术NST数据集)上微调wav2vec 2.0模型。
  • 将计划性语音(NST)与半即兴语音(NPSC)结合,以提升模型在域内与域外数据上的泛化能力并降低WER。
  • 训练参数量不同的模型(300M与1B参数),并对比是否加入语言模型,以评估模型规模与语言建模对识别准确率的影响。
  • 应用5-gram语言模型以提升转录质量,尤其针对挪威语中未登录词与形态复杂的词汇。
  • 将FLEURS中的转录文本规范化为与NPSC和NST一致的格式,以确保评估一致性,包括将数字与时间展开书写。
  • 发布表现最佳的模型与代码,以确保可复现性,并支持未来挪威语ASR研究。

实验结果

研究问题

  • RQ1将计划性语音(NST)与半即兴语音(NPSC)结合,对挪威语Bokmål与Nynorsk的ASR性能有何影响?
  • RQ2更大的模型规模(300M vs. 1B参数)在挪威语ASR基准上能多大程度改善WER?
  • RQ3语言模型能否显著降低形态丰富且方言多变的挪威语语音识别中的WER?
  • RQ4模型在域外数据(如FLEURS中的挪威语子集)上的性能如何泛化?
  • RQ5增加额外的计划性语音数据是否能在不损害未脚本语音性能的前提下提升模型鲁棒性?

主要发现

  • 表现最佳的300M模型在挪威语Bokmål上实现5.81%的WER,在Nynorsk上实现11.54%的WER,显著优于先前SOTA(NPSC上为17.10%)。
  • 1B参数模型在Bokmål(5.81% vs. 7.14% WER)与Nynorsk(11.54% vs. 12.68% WER)上均优于300M模型,证明了模型容量提升的益处。
  • 在1B设置下,将400余小时的计划性语音(NST)加入NPSC数据集,使Bokmål的WER从6.41%降至5.81%,表明多样化数据可显著提升性能。
  • 300M模型在FLEURS挪威语测试集上实现9.88%的WER,优于Whisper small(24.20%),并接近Whisper large(9.50%),尽管参数量更少。
  • NST-NPSC-Bokmål 1B模型在FLEURS上实现9.87%的WER,优于Whisper large(11.40%)与无语言模型的1B模型。
  • 语言模型的引入使300M模型的WER降低最多达3.5个百分点,1B模型降低最多达2.5个百分点,证实其在处理形态复杂性方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。