Skip to main content
QUICK REVIEW

[论文解读] Incremental Text-to-Speech Synthesis with Prefix-to-Prefix Framework

Mingbo Ma, Baigong Zheng|arXiv (Cornell University)|Nov 7, 2019
Speech Recognition and Synthesis参考文献 30被引用 5
一句话总结

本文提出一种前缀到前缀的框架,用于增量式文本到语音(TTS)合成,通过在播放音频片段的同时实时生成语音,实现 O(1) 延迟,同时保持与完整句子 TTS 相当的自然度。该方法仅需 1–2 个词的前瞻,即可实现低延迟、连续的音频生成,适用于对话系统和辅助技术等实时应用场景。

ABSTRACT

Text-to-speech synthesis (TTS) has witnessed rapid progress in recent years, where neural methods became capable of producing audios with high naturalness. However, these efforts still suffer from two types of latencies: (a) the {\em computational latency} (synthesizing time), which grows linearly with the sentence length even with parallel approaches, and (b) the {\em input latency} in scenarios where the input text is incrementally generated (such as in simultaneous translation, dialog generation, and assistive technologies). To reduce these latencies, we devise the first neural incremental TTS approach based on the recently proposed prefix-to-prefix framework. We synthesize speech in an online fashion, playing a segment of audio while generating the next, resulting in an $O(1)$ rather than $O(n)$ latency.

研究动机与目标

  • 降低神经 TTS 系统中的计算和输入延迟,特别是在输入文本逐段到达的场景中。
  • 实现实时、低延迟的 TTS 合成,无需微调现有模型,同时保持高语音自然度。
  • 通过确保音频生成与播放同步,实现无缝、连续的音频播放。
  • 通过支持高效的 CPU 和 GPU 推理,证明设备端 TTS 的实际可行性。

提出的方法

  • 将同步翻译中的前缀到前缀推理框架适配至神经 TTS,实现增量生成。
  • 使用单调注意力机制以定位输入依赖关系,实现无需微调的安全且稳定的增量推理。
  • 实施前瞻-k 策略,即语音生成比输入滞后 k 个词(k=1 或 2),以确保高质量合成所需的足够上下文。
  • 将 TTS 流水线分解为模块化阶段(文本到音素、音素到频谱图、频谱图到波形),支持并行处理。
  • 通过在合成完成后立即生成并播放音频块,实现实时音频播放,最大限度减少端到端延迟。
  • 使用时间平衡分析验证音频生成始终在下一音频块播放开始前完成,确保不间断流媒体播放。

实验结果

研究问题

  • RQ1前缀到前缀框架能否有效适配至神经 TTS,实现在不微调模型的前提下低延迟合成?
  • RQ2所提出的增量 TTS 方法在语音自然度和延迟方面与完整句子 TTS 相比如何?
  • RQ3该系统能否在不同句子长度和语言下维持连续的音频播放而不中断?
  • RQ4前瞻长度(k)对增量 TTS 中语音质量和延迟的影响如何?
  • RQ5该方法能否支持 CPU 和 GPU 上的高效推理,以实现设备端部署?

主要发现

  • 所提出的增量 TTS 实现了 O(1) 延迟,无论句子长度如何,英语和中文的合成时间均低于 0.3 秒,而完整句子 TTS 的延迟为 O(n)。
  • 语音质量通过 MOS 测量,与完整句子 TTS 相当,尽管采用增量生成方式,也未出现显著退化。
  • 时间平衡分析表明,音频生成始终在下一音频块播放开始前完成,支持连续播放且无中断。
  • 在影子实验中,增量 TTS 对英语和中文的延迟均保持在 2.5 秒以下的恒定值,而完整句子 TTS 的延迟随句子长度线性增加。
  • 该方法支持在 CPU 和 GPU 上的高效推理,证明了其在设备端 TTS 部署中的可行性。
  • 前瞻-1 和前瞻-2 策略在延迟和语音质量方面均优于基线方法,凸显了前瞻上下文的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。