Skip to main content
QUICK REVIEW

[论文解读] Natural language guidance of high-fidelity text-to-speech with synthetic annotations

Dan Lyth, Simon King|arXiv (Cornell University)|Feb 2, 2024
Natural Language Processing Techniques被引用 4
一句话总结

该论文提出了一种可扩展的、全自动的方法,通过自然语言条件控制生成高保真度文本到语音(TTS)输出,方法是利用45,000小时数据集上的自监督标签化技术,合成语音属性(如口音、音高、语速、录音条件等)。该方法仅使用1%的高保真度数据和现代音频编解码器,通过单一模型实现零样本提示控制,实现了最先进的音质与自然度表现,优于先前的Audiobox等方法。

ABSTRACT

Text-to-speech models trained on large-scale datasets have demonstrated impressive in-context learning capabilities and naturalness. However, control of speaker identity and style in these models typically requires conditioning on reference speech recordings, limiting creative applications. Alternatively, natural language prompting of speaker identity and style has demonstrated promising results and provides an intuitive method of control. However, reliance on human-labeled descriptions prevents scaling to large datasets. Our work bridges the gap between these two approaches. We propose a scalable method for labeling various aspects of speaker identity, style, and recording conditions. We then apply this method to a 45k hour dataset, which we use to train a speech language model. Furthermore, we propose simple methods for increasing audio fidelity, significantly outperforming recent work despite relying entirely on found data. Our results demonstrate high-fidelity speech generation in a diverse range of accents, prosodic styles, channel conditions, and acoustic conditions, all accomplished with a single model and intuitive natural language conditioning. Audio samples can be heard at https://text-description-to-speech.com/.

研究动机与目标

  • 为克服人工标注语音描述在自然语言控制TTS中的可扩展性瓶颈。
  • 仅通过自然语言提示实现跨口音、语调和录音条件的高保真、多样化语音生成。
  • 训练一个统一的语音语言模型,使其能泛化至未见过的说话人身份、风格和信道条件组合。
  • 通过利用最先进的音频编解码器,仅使用极少的高保真数据实现高音频保真度。
  • 证明自动标注可达到或超越人工标注基线在TTS控制与质量方面的表现。

提出的方法

  • 通过计算度量与自监督建模相结合的方式,从45,000小时数据集中自动提取并标注语音属性(性别、口音、音高、语速、信道条件)。
  • 使用在自动标注数据上微调的大规模语音语言模型,生成受自然语言描述条件控制的语音。
  • 应用DAC音频编解码器以提升音频保真度,即使训练数据中仅包含1%的高保真样本。
  • 利用一小部分高质量数据(LibriTTS-R,约500小时)引导模型生成高保真输出,尽管大部分数据为低保真度。
  • 通过输入控制多个属性的自然语言描述,生成多样化的语音样本。
  • 采用音量归一化与静音裁剪,确保主观评估的公平性,使与真实样本及基线模型的比较具有一致性。
Figure 1 : Overview of the model architecture
Figure 1 : Overview of the model architecture

实验结果

研究问题

  • RQ1完全自动化的、基于合成的语音属性标注能否实现可扩展的、高保真度的自然语言控制TTS?
  • RQ2单一模型在仅使用自然语言提示的情况下,对未见过的说话人身份、语调和录音条件组合的泛化能力如何?
  • RQ3通过结合合成标注与先进音频编解码器,能否在仅使用极少高保真数据的情况下实现高音频保真度?
  • RQ4在自然度与描述对齐方面,使用自动标注数据训练的模型与使用人工标注数据训练的模型相比表现如何?
  • RQ5当与合成标注和有限的高保真数据结合时,使用现代音频编解码器(DAC)是否能显著提升音频质量?

主要发现

  • 该模型在主观自然度评估中获得MOS 3.92,显著优于Audiobox(2.79),甚至超过真实样本(3.67)。
  • 在描述对齐相关性方面,模型得分3.88,优于Audiobox(3.19)和真实样本(3.62),表明其对提示指令的遵循更佳。
  • 该模型的PESQ得分为3.84,接近真实样本(4.15),STOI为0.996,表明语音可懂度与质量均很高。
  • 尽管仅使用约500小时高保真数据(占总量的1%),该模型生成的音频在感知质量上仍超过Audiobox,后者使用了更多数据和人工标注。
  • 客观指标显示,模型合成的标签(如音高、语速)与描述标签高度相关,95%置信区间表明其可靠性高。
  • 该模型能泛化至未见过的属性组合,如非母语口音和噪声录音条件,且全部通过单一自然语言提示实现控制。
Figure 2 : Estimated SNR across the MLS dataset and the discrete bin boundaries used to create keywords.
Figure 2 : Estimated SNR across the MLS dataset and the discrete bin boundaries used to create keywords.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。