[论文解读] Machine Speech Chain with One-shot Speaker Adaptation
本文提出了一种机器语音链框架,通过整合说话人识别与零样本说话人自适应,使端到端自动语音识别(ASR)和文本到语音(TTS)模型能够通过自监督学习联合提升。通过使用来自未见说话人的单个参考样本,TTS 可生成该说话人语音,ASR 则通过学习多样化的说话人特征获益,在 WSJ eval92 上达到 9.86% 的词错误率(CER)——接近 7.12% 的理论上限。
In previous work, we developed a closed-loop speech chain model based on deep learning, in which the architecture enabled the automatic speech recognition (ASR) and text-to-speech synthesis (TTS) components to mutually improve their performance. This was accomplished by the two parts teaching each other using both labeled and unlabeled data. This approach could significantly improve model performance within a single-speaker speech dataset, but only a slight increase could be gained in multi-speaker tasks. Furthermore, the model is still unable to handle unseen speakers. In this paper, we present a new speech chain mechanism by integrating a speaker recognition model inside the loop. We also propose extending the capability of TTS to handle unseen speakers by implementing one-shot speaker adaptation. This enables TTS to mimic voice characteristics from one speaker to another with only a one-shot speaker sample, even from a text without any speaker information. In the speech chain loop mechanism, ASR also benefits from the ability to further learn an arbitrary speaker's characteristics from the generated speech waveform, resulting in a significant improvement in the recognition rate.
研究动机与目标
- 解决先前语音链模型在多说话人训练中处理未见说话人时的局限性。
- 通过将说话人识别整合到循环中,克服语音-文本映射中的信息损失。
- 仅使用一个参考样本(零样本自适应)使 TTS 实现对未见说话人的泛化。
- 通过适配后的 TTS 生成的多样化说话人特征,提升 ASR 性能。
- 在闭环框架中,通过使用成对和非成对语音-文本数据,证明半监督学习的有效性。
提出的方法
- 将说话人识别模型(DeepSpeaker)集成到机器语音链循环中,从语音中提取说话人嵌入。
- 通过基于单个参考说话人嵌入进行条件控制,在 TTS 中实现零样本说话人自适应,以生成新说话人的语音。
- 通过反馈回路,使用成对(语音-文本)和非成对(仅语音或仅文本)数据,联合训练 ASR 与 TTS。
- 在训练过程中对 ASR 与 TTS 均采用教师强制(teacher-forcing),将一个组件的预测输出作为另一个组件的输入。
- 通过从 ASR 生成文本、从 TTS 重建语音,利用无标签数据实现自监督学习。
- 使用同一语音信号的说话人嵌入来条件化 TTS,实现仅凭单一样本即可完成语音克隆。
实验结果
研究问题
- RQ1机器语音链模型是否能仅使用一个参考样本有效处理未见说话人?
- RQ2将说话人识别整合到语音链循环中,如何提升多说话人数据上 ASR 与 TTS 的性能?
- RQ3TTS 中的零样本说话人自适应在多大程度上提升了合成语音的多样性与真实感?
- RQ4ASR 与 TTS 之间的闭环反馈机制是否在半监督学习设置中带来显著性能提升?
- RQ5所提出的框架是否能在无需大量成对数据的情况下,实现接近监督学习上限的性能?
主要发现
- 所提出的语音链模型在使用半监督学习(SI84 成对数据与 SI200 非成对数据)的情况下,在 WSJ eval92 测试集上达到 9.86% 的 CER,显著优于基线模型(17.35%)与标签传播方法(14.58%)。
- 所提出的语音链框架下,TTS 模型的 log-Mel 梅尔谱图 L2-范数平方误差为 0.886,接近监督学习的上限值 0.836。
- 零样本说话人自适应使 TTS 能够仅使用一个参考样本,即生成高质量的未见说话人语音。
- ASR 通过学习由适配后 TTS 生成的具有多样化说话人特征的合成语音,性能显著提升。
- 将说话人识别整合到循环中,使系统能够有效建模说话人差异性,减少语音链中的信息损失。
- 该模型在未见说话人上表现出强大的泛化能力,克服了以往语音链方法依赖固定说话人身份的关键局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。