Skip to main content
QUICK REVIEW

[論文レビュー] SqueezeWave: Extremely Lightweight Vocoders for On-device Speech Synthesis

Bohan Zhai, Tianren Gao|arXiv (Cornell University)|Jan 16, 2020
Speech Recognition and Synthesis参考文献 16被引用数 21
ひとこと要約

SqueezeWaveは、WaveGlowを基盤として、61倍から214倍の少ないMAC演算を実現する超軽量でフローベースの音声生成器のファミリーを提案する。これにより、MacBook や Raspberry Pi 3B+ などのCPUでのリアルタイム音声合成が可能となり、波形品質に近い音質を実現する。計算コストはWaveGlowの数分のの一にまで低減される。

ABSTRACT

Automatic speech synthesis is a challenging task that is becoming increasingly important as edge devices begin to interact with users through speech. Typical text-to-speech pipelines include a vocoder, which translates intermediate audio representations into an audio waveform. Most existing vocoders are difficult to parallelize since each generated sample is conditioned on previous samples. WaveGlow is a flow-based feed-forward alternative to these auto-regressive models (Prenger et al., 2019). However, while WaveGlow can be easily parallelized, the model is too expensive for real-time speech synthesis on the edge. This paper presents SqueezeWave, a family of lightweight vocoders based on WaveGlow that can generate audio of similar quality to WaveGlow with 61x - 214x fewer MACs. Code, trained models, and generated audio are publicly available at https://github.com/tianrengao/SqueezeWave.

研究の動機と目的

  • 神経音声生成器の計算コストを大幅に削減することで、リアルタイムでオンデバイスでのテキスト音声合成を可能にすること。
  • MAC演算とモデルパラメータを最小限に抑えることで、エッジデバイス向けにフローベースのWaveGlowアーキテクチャを適応すること。
  • モバイルおよび組み込みデバイス向けに、モデルサイズと推論遅延を低減しながらも、高い音質を維持すること。
  • 極めて高い計算効率を実現する神経ネットワークアーキテクチャ設計が、準最先端の音声品質を達成できることを示すこと。

提案手法

  • 計算オーバーヘッドを低減するため、音声テンソルを再配置して効率的なグループ化畳み込みを可能にする。
  • 標準畳み込みを深度可分畳み込みに置き換えることで、パラメータ数とMAC演算数を削減する。
  • WaveGlowの結合層に含まれる2つの並列ブランチを、出力チャネル数を半分にした1つのパスに統合し、アーキテクチャを単純化する。
  • 残差スキップ接続を最適化し、出力チャネル数を半分にすることで、計算負荷を低減しながら性能に影響を与えない。
  • WaveGlowは8台のV100 GPU、SqueezeWaveは24台のTitan RTX GPUを用いて、LJSpeechデータセット上でSqueezeWaveモデルをスクラッチから訓練する。
  • Macbook Pro や Raspberry Pi 3B+ などのCPUオンリーデバイスにモデルをデプロイし、リアルタイム推論速度を測定する。

実験結果

リサーチクエスチョン

  • RQ1フローベースの音声生成器は、CPUオンリーデバイスでのリアルタイム推論が可能なほど十分に軽量化可能だろうか?
  • RQ2WaveGlowに施されたアーキテクチャ的変更は、MAC演算をどの程度削減できるだろうか?また、音質は保持できるか?
  • RQ3低性能ハードウェア上で、SqueezeWaveとWaveGlowのMOS、MAC数、推論速度の観点での性能差は何か?
  • RQ4WaveGlowに比べて332倍も少ないMAC演算を必要とするモデルでも、人間の耳に許容できる音質を実現できるだろうか?

主な発見

  • SqueezeWaveモデルは、WaveGlowに比べて61倍から214倍の少ないMAC演算を実現し、最大モデル(SW-128L)では22kHz音声の1秒あたり3.78 GMACsにまで低減される。
  • MacBook Proでは、SqueezeWaveが1秒間に123K~303Kサンプルを生成し、リアルタイム(22kHz)の5.6倍から13.8倍の速度で動作する。
  • Raspberry Pi 3B+ では、SqueezeWaveが最大1秒間に21Kサンプルを生成し、SW-128Sはニアリアルタイム性能(15.6Kサンプル/秒)に達する。
  • 最大モデル(SW-128L)はMOS 4.07 ± 0.06を達成し、WaveGlowの4.57 ± 0.04に近く、複雑さが低減されているにもかかわらず高い知覚的音質を実現している。
  • 最小モデル(SW-64S)はわずか0.69 GMACs(WaveGlowに比べ332倍少ない)を消費するが、MOSは2.74 ± 0.04にとどまり、効率性と音質のトレードオフが顕在化している。
  • WaveGlowはRaspberry Pi 3B+ で動作しなかったが、SqueezeWaveの全バージョンは正常に動作し、低リソースエッジデプロイメントへの実用性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。