Skip to main content
QUICK REVIEW

[论文解读] Google Crowdsourced Speech Corpora and Related Open-Source Resources for Low-Resource Languages and Dialects: An Overview

Alena Butryna, Shan-Hui Cathy Chu|arXiv (Cornell University)|Oct 13, 2020
Natural Language Processing Techniques被引用 10
一句话总结

本文提出了一种众包方法,用于为南亚、东南亚、非洲、欧洲和南美洲的低资源语言及濒危语言创建免费、开源的语音语料库。通过与当地社区和大学合作,作者收集了超过1,500小时的语音数据,涵盖38个数据集,支持高质量的文本转语音和自动语音识别系统,多语言模型在不同语系间展现出迁移学习的潜力。

ABSTRACT

This paper presents an overview of a program designed to address the growing need for developing freely available speech resources for under-represented languages. At present we have released 38 datasets for building text-to-speech and automatic speech recognition applications for languages and dialects of South and Southeast Asia, Africa, Europe and South America. The paper describes the methodology used for developing such corpora and presents some of our findings that could benefit under-represented language communities.

研究动机与目标

  • 为解决低资源和濒危语言在互联网使用增长但语言技术获取受限地区所面临的语音资源匮乏问题。
  • 开发一种可扩展、可复现的方法,使本地社区能够利用开源工具和发布的数据集,构建定制化的语音应用。
  • 通过创建针对特定方言的语料库,改善区域方言的语音技术,使其比以主导方言为基础的系统更符合本地社区需求。
  • 同时支持自动语音识别(ASR)和文本转语音(TTS)应用,这两类应用具有不同的数据和质量要求。
  • 通过在无限制许可下发布资源并鼓励社区主导的数据收集和语言资源开发,实现长期可持续发展。

提出的方法

  • 通过与本地大学和社区合作,利用众包方式,从具有多样化语言和文化背景的母语者中收集语音数据。
  • 设计了数据收集协议,以确保高质量的音频和语言多样性,有针对性地招募涵盖不同年龄、性别和地区差异的说话人。
  • 采用ASR与TTS并重的双重策略:ASR需要大规模、多说话人的语料库,涵盖多样口音;而TTS则需要较少但高质量的录音,且发音清晰。
  • 利用迁移学习和多语言建模技术,通过整合相关语言(如印度-雅利安语和德拉维达语)的语料库,提升低资源语言的性能。
  • 整合开源工具和类型学资源(如PHOIBLE),以支持音系学分析,降低对稀有语言专业知识的依赖。
  • 将所有数据集以知识共享许可发布,以支持研究人员和本地开发者的再利用、改编和扩展。

实验结果

研究问题

  • RQ1一种可扩展、社区驱动的众包模式是否能有效为缺乏现有语言基础设施的低资源语言生产高质量语音语料库?
  • RQ2在结合相关语系家族的语料库上训练的多语言模型,在低资源目标语言(包括未在训练集中出现的语言)上的性能提升程度如何?
  • RQ3如何设计开源、可本地适配的方法论,以赋能本地技术人员为其母语构建并扩展语音技术?
  • RQ4类型学和音系学资源在降低低资源语言环境下开发语音系统的技术门槛方面发挥何种作用?
  • RQ5当数据量和说话人多样性受语言和文化因素制约时,如何优化语音语料库的质量和实用性?

主要发现

  • 该项目成功收集并发布了总计超过1,500小时语音的38个语音语料库,覆盖南亚、东南亚、非洲、欧洲和南美洲的语言及方言。
  • 在结合印度-雅利安语和德拉维达语语料库上训练的多语言模型展现出迁移学习能力,使无需直接训练数据的低资源语言(如奥里亚语和旁遮普语)也能实现语音合成。
  • 将多个语言的多说话人众包语料库相结合,显著提升了模型性能,即使初始性能较低,也优于单一语言基线模型。
  • 使用开源类型学资源(如PHOIBLE)极大加速了语言学分析过程,并在语料库开发过程中降低了对稀缺专家知识的依赖。
  • 迁移学习技术使深度学习模型能够有效适应低资源语言,即使数据有限或质量参差不齐。
  • 该计划的方法论被证明具有可复制性和社区友好性,本地合作伙伴在数据收集和质量保证中发挥了关键作用,从而产生了高质量、符合文化背景的语音数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。