[论文解读] Zero-Shot Multi-Speaker Text-To-Speech with State-of-the-art Neural Speaker Embeddings
该论文提出了一种基于最先进神经说话人嵌入的零样本多说话人文本到语音合成方法,具体采用可学习词典编码(LDE)结合角度软max损失,与传统的x-vectors相比,显著提升了未见说话人的说话人相似度和自然度。表现最佳的系统(LDE-3)在未见测试说话人上的说话人相似度(DMOS 2.46)和自然度(MOS 3.48)均达到统计学上更优的结果,分别优于x-vectors(p=0.02 和 p=5.9e-11)。
While speaker adaptation for end-to-end speech synthesis using speaker embeddings can produce good speaker similarity for speakers seen during training, there remains a gap for zero-shot adaptation to unseen speakers. We investigate multi-speaker modeling for end-to-end text-to-speech synthesis and study the effects of different types of state-of-the-art neural speaker embeddings on speaker similarity for unseen speakers. Learnable dictionary encoding-based speaker embeddings with angular softmax loss can improve equal error rates over x-vectors in a speaker verification task; these embeddings also improve speaker similarity and naturalness for unseen speakers when used for zero-shot adaptation to new speakers in end-to-end speech synthesis.
研究动机与目标
- 探究最先进神经说话人嵌入是否能提升端到端文本到语音合成中未见说话人的零样本说话人自适应能力。
- 确定在大规模多样化说话人验证数据上训练的说话人嵌入是否能提升TTS中未见说话人的说话人相似度与自然度。
- 比较不同说话人嵌入类型(特别是结合角度软max的LDE)与标准x-vectors在零样本TTS中的有效性。
- 评估在自动说话人验证(ASV)中表现最佳的嵌入是否也能在TTS中取得最优结果。
- 识别ASV性能(EER)与TTS质量度量(MOS、DMOS)之间是否存在相关性。
提出的方法
- 扩展了一个改进的Tacotron模型,通过在预网络和注意力机制中注入说话人嵌入,支持多说话人TTS。
- 使用不同说话人嵌入类型训练了15个独立的TTS模型:14种LDE嵌入变体和x-vectors,每种均包含与不包含后处理归一化(N)。
- 采用可学习词典编码(LDE)作为池化层,从帧级表示生成固定维度的语音段级嵌入。
- 在说话人嵌入网络训练中应用角度软max损失,以增强判别能力并改善说话人空间中的嵌入聚类。
- 采用基于性别的训练设置,以提升嵌入的泛化能力并减少对已见说话人的过拟合。
- 通过463名受试者的众包听音测试,评估未见说话人的MOS(自然度)和DMOS(说话人相似度),参考语音来自目标说话人。
实验结果
研究问题
- RQ1最先进说话人嵌入(特别是结合角度软max的LDE)是否能提升端到端TTS中未见说话人的零样本说话人自适应能力?
- RQ2在大规模多样化说话人验证数据上训练的说话人嵌入是否能带来比x-vectors更好的说话人相似度与自然度?
- RQ3自动说话人验证(ASV)性能(EER)与TTS质量度量(如MOS和DMOS)之间是否存在相关性?
- RQ4哪种特定的嵌入架构与训练目标组合能为未见说话人合成带来最佳性能?
- RQ5后处理归一化(N)是否显著提升不同嵌入类型下的TTS质量或说话人相似度?
主要发现
- LDE-3嵌入配置在未见测试说话人上实现了最高的MOS(3.48)和DMOS(2.46),显著优于x-vectors(MOS的p=5.9e-11,DMOS的p=0.02)。
- 基于LDE的嵌入提升了未见说话人的说话人相似度与自然度,其中表现最佳的LDE变体(LDE-3)在未见说话人上的DMOS较x-vectors提升了1.5分。
- LDE-3系统在所有嵌入中实现了最低的等错误率(EER),证实其在说话人验证中具有更优的判别能力。
- 未发现ASV性能(EER)与TTS质量度量(MOS或DMOS)之间存在有意义的相关性,表明高ASV准确率并不一定预示更好的TTS性能。
- 后处理归一化(N)对性能影响极小,表明核心嵌入架构与训练目标比简单归一化更为关键。
- 尽管性能有所提升,未见说话人的说话人相似度仍显著低于已见说话人,表明对训练说话人仍存在持续过拟合,且仍有进一步改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。