[论文解读] Listening while Speaking: Speech Chain by Deep Learning
本文提出了一种基于深度学习的闭环语音链模型,通过同时使用有标签和无标签数据,联合训练自动语音识别(ASR)和文本到语音(TTS)系统。通过实现相互监督机制——其中ASR对TTS生成的合成语音进行转录,TTS则根据ASR输出重建语音——该模型在无需配对数据的情况下提升了两个任务的性能,在ASR词错误率和TTS质量指标上均取得了显著提升。
Despite the close relationship between speech perception and production, research in automatic speech recognition (ASR) and text-to-speech synthesis (TTS) has progressed more or less independently without exerting much mutual influence on each other. In human communication, on the other hand, a closed-loop speech chain mechanism with auditory feedback from the speaker's mouth to her ear is crucial. In this paper, we take a step further and develop a closed-loop speech chain model based on deep learning. The sequence-to-sequence model in close-loop architecture allows us to train our model on the concatenation of both labeled and unlabeled data. While ASR transcribes the unlabeled speech features, TTS attempts to reconstruct the original speech waveform based on the text from ASR. In the opposite direction, ASR also attempts to reconstruct the original text transcription given the synthesized speech. To the best of our knowledge, this is the first deep learning model that integrates human speech perception and production behaviors. Our experimental results show that the proposed approach significantly improved the performance more than separate systems that were only trained with labeled data.
研究动机与目标
- 弥合自动语音识别(ASR)与文本到语音(TTS)研究之间的差距,尽管两者在人类语音交流中具有共同作用,但历史上一直独立发展。
- 通过在神经网络中实现闭环学习架构,模拟人类语音链机制,即说话者通过听觉反馈监控自身语音。
- 通过ASR与TTS系统之间的相互监督,利用有标签和无标签数据联合提升ASR与TTS性能。
- 在单说话人合成数据集和多说话人真实语音数据集上验证该联合训练框架的有效性。
提出的方法
- 提出一种序列到序列的闭环架构模型,交替使用有标签的语音-文本配对数据和无标签的语音或文本数据进行ASR与TTS的联合训练。
- 训练过程中采用教师强制(teacher-forcing)策略:ASR使用真实转录文本从语音中生成文本,TTS使用真实文本从文本中生成语音。
- 引入双学习机制:ASR从TTS生成的语音中重建文本,TTS从ASR生成的文本中重建语音,形成反馈回路。
- 利用重建任务的无监督损失:对合成语音的ASR损失和对重建语音波形的TTS损失。
- 采用有监督损失(在配对数据上)与无监督损失(在非配对数据上)的加权组合,其中超参数α和β控制损失之间的平衡。
- 通过冻结除说话人嵌入层外的所有层,将预训练的单说话人模型知识迁移至多说话人设置。
实验结果
研究问题
- RQ1是否可以通过整合ASR与TTS的联合训练框架,在仅使用有标签数据单独训练的基础上进一步提升性能?
- RQ2仅使用非配对数据时,ASR与TTS之间的相互监督在多大程度上能有效提升两个系统?
- RQ3包含从语音合成到识别的反馈的闭环架构是否能增强ASR与TTS任务的鲁棒性与准确性?
- RQ4不同的超参数设置(α与β)如何影响联合训练中的性能增益?
- RQ5所提出的模型是否能在多说话人场景下实现泛化,并提升自然、即兴语音的性能?
主要发现
- 所提出的闭环语音链模型在多说话人测试集上实现了20.91%的词错误率(WER),当α=0.5且β=1时,优于仅使用配对数据的基线模型(26.47% WER)。
- 当在配对与非配对数据上同时训练时,梅尔倒谱图重建损失从10.213降至9.137,原始波形损失从13.175降至12.863。
- 在多说话人设置中,使用α=0.5相比α=0.25性能显著提升,表明当初始模型准确性较低时,更强的配对数据监督具有优势。
- 该模型在多说话人测试集上实现了98.6%的说话人验证准确率,表明其在说话人身份保持方面具有鲁棒性。
- 与非配对数据联合训练在ASR与TTS上均带来持续性能提升,表明相互反馈有助于表征学习。
- 该方法是首个在深度学习框架中整合类人语音感知与生成行为的研究,证明了端到端语音链建模的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。