[论文解读] Residual Adapters for Few-Shot Text-to-Speech Speaker Adaptation
本文提出残差适配器用于少样本文本到语音说话人适配,实现仅需骨干模型约0.1%参数的参数高效语音克隆。通过冻结预训练的多说话人TTS骨干网络,并在关键层插入轻量级残差适配器,该方法仅使用1–5分钟目标说话人数据即可实现具有竞争力的自然度与说话人相似度,同时通过模型共享显著降低推理成本。
Adapting a neural text-to-speech (TTS) model to a target speaker typically involves fine-tuning most if not all of the parameters of a pretrained multi-speaker backbone model. However, serving hundreds of fine-tuned neural TTS models is expensive as each of them requires significant footprint and separate computational resources (e.g., accelerators, memory). To scale speaker adapted neural TTS voices to hundreds of speakers while preserving the naturalness and speaker similarity, this paper proposes a parameter-efficient few-shot speaker adaptation, where the backbone model is augmented with trainable lightweight modules called residual adapters. This architecture allows the backbone model to be shared across different target speakers. Experimental results show that the proposed approach can achieve competitive naturalness and speaker similarity compared to the full fine-tuning approaches, while requiring only $\sim$0.1% of the backbone model parameters for each speaker.
研究动机与目标
- 解决为数百种自定义语音微调完整TTS模型所带来的高计算与内存开销问题。
- 通过极少量数据实现对单个预训练TTS骨干网络的参数高效、少样本适配,以适应新说话人。
- 在通过共享骨干模型降低服务成本的同时,保持高自然度与说话人相似度。
- 探索残差适配器在TTS中的有效性,尤其与全量微调和零样本基线进行对比。
- 评估适配器大小、位置以及训练数据量对适配质量的影响。
提出的方法
- 冻结预训练的多说话人TTS骨干网络,并在特定层(如变体适配器和解码器)插入轻量级残差适配模块。
- 残差适配器是小型可训练前馈网络,通过瓶颈结构将输入特征映射,实现参数高效的适配。
- 在适配过程中,仅更新适配器参数,使用少量目标说话人数据(1–30分钟),而骨干网络保持固定。
- 适配器以残差方式应用:输出为原始层输出与适配器输出之和,从而保留原始模型行为。
- 通过在推理时加载不同的适配器权重,同一冻结骨干模型可被多个说话人共享。
- 通过客观指标(MOS、余弦相似度)和主观听音测试,在不同数据量和适配器配置下对方法进行评估。
实验结果
研究问题
- RQ1残差适配器是否能在极小参数更新下实现与全量微调相当的说话人相似度与自然度?
- RQ2适配器位置(如变体适配器与解码器中)如何影响合成质量?
- RQ3适配器大小与目标说话人数据量对性能有何影响?
- RQ4与全量微调和零样本基线相比,该方法在质量与效率方面表现如何?
- RQ5该方法是否能在仅1分钟目标说话人数据下维持高性能?
主要发现
- 即使仅使用1分钟目标说话人数据,该方法在自然度与说话人相似度方面仍与全量微调方法具有竞争力。
- 使用1分钟数据时,该方法在女性说话人上保持了较高的说话人相似度(余弦相似度约0.39),在低数据条件下优于微调基线。
- 插入解码器中的残差适配器性能优于插入变体适配器的版本,后者导致自然度下降与音调异常。
- 该方法每说话人仅需骨干模型约0.1%的参数,实现了向数百种语音的低成本扩展。
- 该模型对数据稀缺具有鲁棒性:当数据从30分钟减少至1分钟时,性能下降极小,MOS与相似度评分无显著下降。
- 该方法优于使用d向量的零样本基线,即使在极少量条件数据下也展现出更优的说话人相似度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。