Skip to main content
QUICK REVIEW

[论文解读] SqueezeWave: Extremely Lightweight Vocoders for On-device Speech Synthesis

Bohan Zhai, Tianren Gao|arXiv (Cornell University)|Jan 16, 2020
Speech Recognition and Synthesis参考文献 16被引用 21
一句话总结

SqueezeWave 提出了一类超轻量级、基于流的声码器,源自 WaveGlow,实现接近波形质量的同时,计算量减少 61 倍至 214 倍,可在 MacBook 和 Raspberry Pi 3B+ 等 CPU 上实现实时端侧语音合成,同时计算成本仅为 WaveGlow 的几分之一,且保持了高音频质量。

ABSTRACT

Automatic speech synthesis is a challenging task that is becoming increasingly important as edge devices begin to interact with users through speech. Typical text-to-speech pipelines include a vocoder, which translates intermediate audio representations into an audio waveform. Most existing vocoders are difficult to parallelize since each generated sample is conditioned on previous samples. WaveGlow is a flow-based feed-forward alternative to these auto-regressive models (Prenger et al., 2019). However, while WaveGlow can be easily parallelized, the model is too expensive for real-time speech synthesis on the edge. This paper presents SqueezeWave, a family of lightweight vocoders based on WaveGlow that can generate audio of similar quality to WaveGlow with 61x - 214x fewer MACs. Code, trained models, and generated audio are publicly available at https://github.com/tianrengao/SqueezeWave.

研究动机与目标

  • 通过大幅降低神经声码器的计算成本,实现实时、端侧文本到语音合成。
  • 通过最小化 MAC 操作和模型参数,将基于流的 WaveGlow 架构适配于边缘设备部署。
  • 在减小模型大小和推理延迟的同时,保持高音频质量,适用于移动和嵌入式设备。
  • 证明高效的神经架构设计可在极端计算效率下实现接近最先进水平的语音质量。

提出的方法

  • 重新排列音频张量,以支持高效的分组卷积,降低计算开销。
  • 用深度可分离卷积替代标准卷积,减少参数量和 MAC 操作。
  • 将 WaveGlow 的耦合层中两个并行分支合并为单一路径,输出通道数减半,简化架构。
  • 通过将残差跳跃连接的输出通道数减半来优化,降低计算负载,同时不损失性能。
  • 在 LJSpeech 数据集上从零开始训练 SqueezeWave 模型,WaveGlow 使用 8 块 V100 GPU,SqueezeWave 使用 24 块 Titan RTX GPU。
  • 在仅含 CPU 的设备(如 Macbook Pro 和 Raspberry Pi 3B+)上部署并评估模型,以测量实时推理速度。

实验结果

研究问题

  • RQ1能否将基于流的声码器优化至足够轻量,实现在仅含 CPU 的边缘设备上的实时推理?
  • RQ2对 WaveGlow 的架构修改能在多大程度上减少 MAC 操作,同时保持音频质量?
  • RQ3在低端硬件上,SqueezeWave 与 WaveGlow 在 MOS、MAC 数和推理速度方面的表现如何比较?
  • RQ4一个相比 WaveGlow 减少 332 倍 MAC 操作的模型,是否仍能产生可接受的感知语音质量?

主要发现

  • SqueezeWave 模型相比 WaveGlow 减少了 61 倍至 214 倍的 MAC 操作,最大模型(SW-128L)每秒仅需 3.78 GMACs 处理 22kHz 音频。
  • 在 Macbook Pro 上,SqueezeWave 每秒生成 123K 至 303K 个样本,速度为实时(22kHz)的 5.6 倍至 13.8 倍。
  • 在 Raspberry Pi 3B+ 上,SqueezeWave 最高可达到每秒 21K 个样本,SW-128S 接近实时性能(15.6K 个样本/秒)。
  • 最大模型 SW-128L 的 MOS 达到 4.07 ± 0.06,接近 WaveGlow 的 4.57 ± 0.04,表明尽管结构简化,仍具备高感知质量。
  • 最小模型 SW-64S 仅使用 0.69 GMACs(相比 WaveGlow 减少 332 倍),但 MOS 为 2.74 ± 0.04,表明效率与质量之间存在权衡。
  • WaveGlow 在 Raspberry Pi 3B+ 上无法运行,而所有 SqueezeWave 变体均可成功运行,证明其在低资源边缘设备上的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。