Skip to main content
QUICK REVIEW

[论文解读] Multilingual Byte2Speech Text-To-Speech Models Are Few-shot Spoken Language Learners

Mutian He, Jingzhou Yang|arXiv (Cornell University)|Mar 5, 2021
Topic Modeling参考文献 19被引用 6
一句话总结

本文提出了一种多语言端到端文本到语音框架,将字节序列映射到声谱图,仅需40秒转录音频即可实现零资源语言适应。该框架在40多种语言的低资源和少样本设置下实现高质量语音合成,无需词典、辅助模型或语言学专业知识,同时提出一种方法以提取语言特定的子网络,提升可解释性。

ABSTRACT

We present a multilingual end-to-end Text-To-Speech framework that maps byte inputs to spectrograms, thus allowing arbitrary input scripts. Besides strong results on 40+ languages, the framework demonstrates capabilities to adapt to various new languages under extreme low-resource and even few-shot scenarios of merely 40s transcribed recording without the need of lexicon, extra corpus, auxiliary models, or particular linguistic expertise, while retains satisfactory intelligibility and naturalness matching rich-resource models. Exhaustive comparative studies are performed to reveal the potential of the framework for low-resource application and the impact of various factors contributory to adaptation. Furthermore, we propose a novel method to extract language-specific sub-networks for a better understanding of the mechanism of multilingual models.

研究动机与目标

  • 开发一种多语言TTS系统,能够在极少量数据下实现对新语言的零资源适应。
  • 消除对词典、外部语料库或语言学专业知识的依赖,以实现低资源语言建模。
  • 探究端到端字节到声谱图学习在少样本语音语言习得中的有效性。
  • 在低资源设置下实现高保真语音合成,性能可与高资源模型相媲美。
  • 通过提取语言特定的子网络,实现可解释性,以理解多语言模型的行为。

提出的方法

  • 该框架采用端到端架构,直接将字节级输入映射到声谱图,跳过分词或语言特定的预处理。
  • 它利用在多种语言上训练的共享多语言主干网络,以实现对不同书写系统和音系的泛化。
  • 该模型通过每种目标语言仅40秒的转录音频进行微调,实现少样本适应。
  • 提出一种新颖的子网络剪枝方法,从共享编码器中分离出语言特定的组件,以分析语言表征学习过程。
  • 该框架无需词典、辅助模型或语言学注释,仅依赖原始音频和文本字节序列。
  • 通过在极少量平行文本-音频对上进行微调实现适应,无需语言特定的头或语言ID输入。

实验结果

研究问题

  • RQ1多语言TTS模型能否仅使用每种语言40秒的转录数据,在低资源语言中实现高质量语音合成?
  • RQ2在无词典、无外部语料库或无语言学专业知识的条件下,该模型在少样本设置下的表现如何?
  • RQ3在极端数据稀缺条件下,哪些因素促成了多语言TTS的成功适应?
  • RQ4语言特定的子网络如何在共享多语言架构中形成?
  • RQ5在无语言特定设计的情况下,该模型在多样化书写系统和音系系统间泛化的程度如何?

主要发现

  • 该模型仅使用每种语言40秒的转录音频,即可在40多种语言中实现高可懂度和自然度,性能与高资源模型相当。
  • 该框架展现出强大的少样本泛化能力,即使在数据极少的情况下仍保持高性能,且无需词典或语言学资源。
  • 可从共享模型中提取语言特定的子网络,揭示了不同语言在表征学习上的差异。
  • 该模型可跨书写系统和音系系统泛化,包括非拉丁字母和低资源语言,且无需架构修改。
  • 详尽的消融实验表明,模型的成功源于其端到端的字节级输入和共享多语言表征学习。
  • 在极端低资源条件下,该框架在自然度和可懂度方面均优于现有少样本TTS方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。