Skip to main content
QUICK REVIEW

[论文解读] Vakyansh: ASR Toolkit for Low Resource Indic languages

Harveen Singh Chadha, Anirudh Gupta|arXiv (Cornell University)|Mar 30, 2022
Speech Recognition and Synthesis被引用 15
一句话总结

Vakyansh 是一个针对低资源印地语系语言的开源端到端自动语音识别(ASR)工具包,引入了跨23种语言的14,000小时未标注语音数据和10,000小时标注语音数据。它通过基于wav2vec 2.0的预训练和微调,实现了最先进的ASR性能,结合语言模型可将词错误率(WER)降低高达20%,并支持标点恢复和逆文本归一化,适用于生产环境推理。

ABSTRACT

We present Vakyansh, an end to end toolkit for Speech Recognition in Indic languages. India is home to almost 121 languages and around 125 crore speakers. Yet most of the languages are low resource in terms of data and pretrained models. Through Vakyansh, we introduce automatic data pipelines for data creation, model training, model evaluation and deployment. We create 14,000 hours of speech data in 23 Indic languages and train wav2vec 2.0 based pretrained models. These pretrained models are then finetuned to create state of the art speech recognition models for 18 Indic languages which are followed by language models and punctuation restoration models. We open source all these resources with a mission that this will inspire the speech community to develop speech first applications using our ASR models in Indic languages.

研究动机与目标

  • 解决低资源印地语系语言缺乏开源、端到端ASR工具包的问题,这些语言数据有限且缺少预训练模型。
  • 为23种印地语系语言构建可扩展、自动化的数据收集、清洗和标注流水线。
  • 利用wav2vec 2.0和迁移学习,为18种印地语系语言训练并发布最先进的ASR模型。
  • 集成下游自然语言处理(NLP)组件,如语言模型、标点恢复和逆文本归一化,以支持生产环境部署。
  • 通过开源数据、模型和工具,推动印度语言的语音优先应用。

提出的方法

  • 使用WebRTC-VAD构建自动化音频处理流水线,进行语音活动检测,并将音频分割为1至15秒的片段,以避免破坏词边界。
  • 应用WADA SNR方法过滤信噪比(SNR)低于20或高于60的低质量音频片段,拒绝35%的初始数据作为噪声数据。
  • 使用Resemblyzer嵌入和HDBSCAN聚类检测并限制每位说话人的贡献时间不超过90分钟,以减少过拟合。
  • 在23种印地语系语言的14,000小时未标注数据上预训练多语言wav2vec 2.0模型,随后在18种语言的10,000小时标注数据上进行微调。
  • 在清洗后的IndicCorp数据上训练5-gram KenLM语言模型,使用束搜索(beam search)并设置语言模型权重为2、词插入惩罚为-1,以提升ASR输出质量。
  • 开发基于多语言IndicBERT的序列标注模型用于标点恢复,并使用基于规则的WFST实现逆文本归一化(ITN)。

实验结果

研究问题

  • RQ1自动化、可扩展的流水线能否为低资源印地语系语言生成高质量、多样化且均衡的语音数据?
  • RQ2在高资源语言(如印地语)上进行多语言预训练,能在多大程度上提升低资源印地语系语言的ASR性能?
  • RQ3语言模型和标点恢复在降低WER和提升ASR输出可读性方面有多有效?
  • RQ4从多语言预训练模型(CLSRIL-23)进行迁移学习,能否在包括低资源语言在内的多种印地语系语言上实现良好泛化?
  • RQ5数据质量指标(如SNR、说话人平衡度、领域多样性)对最终ASR模型性能有何影响?

主要发现

  • 使用语言模型后,Vakyansh工具包在平均WER上实现了20%的降低,其中印地语的WER从17.81降至11.53。
  • 多语言CLSRIL-23预训练模型使低资源语言的微调成为可能,即使目标语言未出现在预训练数据中也有效。
  • 基于IndicBERT的标点恢复显著降低了ASR输出的歧义性,提升了下游NLP任务的文本可读性。
  • 通过WFST实现的逆文本归一化成功将口语化数字表达(如“one thousand two hundred”)转换为标准书面形式。
  • 该流水线实现了高质量数据,因噪声问题拒绝了35%的初始音频片段,并确保了性别和说话人分布的平衡。
  • 针对低资源语言(如多格里语3.5小时、马拉地语3小时、阿萨姆语1.2小时)的模型WER低于35%,证明了数据高效训练的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。