[論文レビュー] LightSpeech: Lightweight and Fast Text to Speech with Neural Architecture Search
LightSpeech は、FastSpeech 2 をベースに、神経的アーキテクチャ探索(NAS)を駆動するアプローチを提案し、軽量で高速な音声合成モデルを自動的に設計する。モデルコンポーネントのプロファイリングと、深度可分畳み込みと効率的なブロックを組み込んだターゲット型の探索空間を設計することで、15倍のモデル圧縮、16倍のMAC数削減、CPU上での6.5倍の高速化を達成し、音声品質は同等水準を維持した。
Text to speech (TTS) has been broadly used to synthesize natural and intelligible speech in different scenarios. Deploying TTS in various end devices such as mobile phones or embedded devices requires extremely small memory usage and inference latency. While non-autoregressive TTS models such as FastSpeech have achieved significantly faster inference speed than autoregressive models, their model size and inference latency are still large for the deployment in resource constrained devices. In this paper, we propose LightSpeech, which leverages neural architecture search~(NAS) to automatically design more lightweight and efficient models based on FastSpeech. We first profile the components of current FastSpeech model and carefully design a novel search space containing various lightweight and potentially effective architectures. Then NAS is utilized to automatically discover well performing architectures within the search space. Experiments show that the model discovered by our method achieves 15x model compression ratio and 6.5x inference speedup on CPU with on par voice quality. Audio demos are provided at https://speechresearch.github.io/lightspeech.
研究の動機と目的
- モバイル端末や組み込みシステムなどのリソース制約のあるデバイスに高品質な TTS モデルをデプロイする課題に対処すること。
- モデルサイズ、推論遅延、計算コスト(MAC数)を音声品質を損なわず削減すること。
- 手動によるモデル圧縮の限界を克服し、性能の著しい低下を招くことがないようすること。
- 特に FastSpeech 2 のような非自己回帰的アーキテクチャを想定した、シーケンス・ツー・シーケンス TTS モデルに特化した探索空間と NAS パイプラインを開発すること。
- NAS が人間が設計した軽量モデルを上回る効率性と性能を、TTS タスクにおいて達成できることを示すこと。
提案手法
- 特にエンコーダー、デコーダー、ばらつき予測器において、メモリと遅延のボトルネックを特定するため、FastSpeech 2 のコンポーネントを詳細にプロファイリングした。
- 深度可分畳み込み(SepConv)、可変カーネルサイズ、削減されたブロック数を含む、新しい探索空間を設計した。モデル容量を保持しつつも、効率的な構成を実現した。
- チェーン構造の探索空間に適した効率性と適合性を考慮し、GBDT-NAS を探索アルゴリズムとして選定した。
- 勾配ブースティング決定木による精度予測を用いて、完全な学習を実施せずに候補アーキテクチャを効率的に評価した。
- SepConv にカーネルサイズ 5, 9, 13, 17, 21, 25 を含む、軽量で効果的なコンポーネントのみを含むように探索空間を最適化した。
- メルスペクトログ램損失と音声品質のための CMOS を含む、標準的な TTS 評価指標に基づき、最終アーキテクチャの訓練と評価を実施した。
実験結果
リサーチクエスチョン
- RQ1神経的アーキテクチャ探索は、効率性と品質の両面で手動設計されたモデルを上回る軽量な TTS アーキテクチャを効果的に発見できるか?
- RQ2探索空間設計の選択が、TTS モデルにおける NAS のパフォーマンスと効率性にどのように影響を与えるか?
- RQ3深度可分畳み込みとアーキテクチャのプルーニングをどれほど活用すれば、モデルサイズと MAC 数を削減しつつ音声品質を損なわないか?
- RQ4NAS を用いた圧縮により、標準の FastSpeech 2 と同等の音声品質を維持しながら、CPU 上で顕著な高速化を達成できるか?
- RQ5NAS によって発見されたモデルの性能は、手動で設計された FastSpeech 2 の軽量バージョンと比較して、推論遅延とモデルサイズの点でどのように異なるか?
主な発見
- NAS によって発見された LightSpeech モデルは、15倍のモデル圧縮比(FastSpeech 2 の 27M パラメータ対比で 1.8M パラメータ)を達成した。
- 計算コストは 16倍削減され、FastSpeech 2 の 12.50G MAC 対比で 0.76G MAC にまで低下した。
- CPU 上での推論時間は 6.5倍高速化され、RTF は 6.1×10⁻² から 9.3×10⁻³ に低下した。
- LightSpeech は同等の音声品質を維持し、CMOS スコアは FastSpeech 2 の 0.2575 に対し 0.2561 を記録した。
- 探索空間からのランダムサンプリングですでに手動設計された軽量 FastSpeech 2*(損失 0.2956 対比で 0.2753)を上回る性能を示し、探索空間の質の高さを裏付けた。
- 最終アーキテクチャは、エンコーダーでカーネルサイズ 5, 25, 13, 9、デコーダーで 17, 21, 9, 13 を使用する SepConv レイヤーのシーケンスであり、すべての隠れ層サイズは 256 であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。