Skip to main content
QUICK REVIEW

[论文解读] Synthesizing Personalized Non-speech Vocalization from Discrete Speech Representations

Chin-Cheng Hsu|arXiv (Cornell University)|Jun 25, 2022
Speech Recognition and Synthesis被引用 4
一句话总结

本文提出了一种文本到语音(TTS)框架,用于使用 HUBERT 的离散语音单元合成个性化的非语音发声(NSVs)。通过将 NSVs 视为一种使用 HUBERT 单元派生的伪音素的文本到语音任务,该模型在少样本训练和异质录音条件下,成功实现了可控的说话人音色合成,展示了从 NSV 数据进行语音转换和说话人建模的可行性。

ABSTRACT

We formulated non-speech vocalization (NSV) modeling as a text-to-speech task and verified its viability. Specifically, we evaluated the phonetic expressivity of HUBERT speech units on NSVs and verified our model's ability to control over speaker timbre even though the training data is speaker few-shot. In addition, we substantiated that the heterogeneity in recording conditions is the major obstacle for NSV modeling. Finally, we discussed five improvements over our method for future research. Audio samples of synthesized NSVs are available on our demo page: https://resemble-ai.github.io/reLaugh.

研究动机与目标

  • 解决由于数据稀疏性、自发性以及缺乏标准化形式而导致的非语音发声(NSV)建模挑战。
  • 探究离散语音表征(HUBERT 单元)是否可作为 NSV 合成的有意义的类文本输入。
  • 评估在每名说话人数据有限(少样本)条件下,控制 NSV 合成中说话人音色的可行性。
  • 评估异质录音条件对说话人嵌入空间和模型泛化能力的影响。
  • 探索基于 NSV 的语音转换和说话人建模的潜力,使用端到端 TTS 框架。

提出的方法

  • 使用预训练的 HUBERT 模型和 K-means 聚类(100 个聚类)将 NSV 音频转录为伪音素,随后通过运行长度编码生成离散单元序列。
  • 采用修改后的 FastSpeech2 架构,以扩张卷积代替 Transformer,配备时长预测器和平行基频解码器,从伪音素预测梅尔频谱图和基频轮廓。
  • 通过说话人标签对声学模型进行条件控制,以实现说话人特定的合成,说话人嵌入通过反向传播进行更新。
  • 使用 HooliGAN(一种基于谐波加噪声建模的神经声码器)将预测的梅尔频谱图和基频轮廓转换为波形。
  • 在 ExVo 数据集上端到端训练模型,训练期间使用上采样的伪音素序列与真实梅尔频谱图对齐。
  • 在推理时支持任意说话人标签,以实现音色迁移,同时保留语音内容。

实验结果

研究问题

  • RQ1HUBERT 的离散语音单元能否作为非语音发声的表达性且有意义的表征?
  • RQ2多说话人文本到语音系统是否能在少样本条件下有效合成多样化的 NSVs 并实现说话人身份控制?
  • RQ3异质录音条件在多大程度上会扭曲 NSV 建模中学习到的说话人嵌入空间?
  • RQ4当在不同 NSV 片段之间迁移说话人身份时,模型是否能保留语音内容?
  • RQ5使用自监督语音表征进行 NSV 合成的关键局限性和改进方向是什么?

主要发现

  • 将 HUBERT 的离散单元(视为伪音素)具有足够的表达能力,可表征各种 NSV 的语音内容,从而在不同输入间实现一致的合成。
  • 在 ExVo Generate 基准测试中,模型对愉悦情绪的说话人相似性精确度达到 0.79,对敬畏情绪为 0.51,显著优于基线模型(分别为 0.49 和 0.46)。
  • 合成 NSV 的 Fréchet Inception Distance(FID)为 0.52 ± 0.03(Syn-1000)和 0.81 ± 0.11(Syn-100),表明其具有较高的感知质量和泛化能力。
  • 模型学习到的说话人嵌入主要受录音条件(如截止频率、编解码器、混响)影响,而非说话人身份,表明录音差异主导了嵌入空间。
  • 模型成功在 NSV 之间迁移说话人音色,同时保留了语音内容,证实了从 NSV 数据进行语音转换的可行性。
  • 模型性能受限于录音条件的异质性,表明若能将录音效应与说话人身份解耦,将显著提升模型鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。