Skip to main content
QUICK REVIEW

[論文レビュー] LVCNet: Efficient Condition-Dependent Modeling Network for Waveform Generation

Zhen Zeng, Jianzong Wang|arXiv (Cornell University)|Feb 22, 2021
Music and Audio Processing参考文献 25被引用数 4
ひとこと要約

この論文では、メルスペクトログ램などの条件特徴に基づいてカーネル係数を適応的に変更する位置可変畳み込みを用いた、LVCNetと呼ばれる新しい条件付き畳み込みネットワークを提案する。この手法により、固定カーネルを用いるParallel WaveGANの代わりに、区間ごとに条件づけられた可変カーネルを採用することで、長時間にわたる波形依存関係を効率的にモデル化できる。元のモデルと比較して品質に劣化を来さずに4倍の高速化を達成し、波形生成における顕著な効率性向上を示した。

ABSTRACT

In this paper, we propose a novel conditional convolution network, named location-variable convolution, to model the dependencies of the waveform sequence. Different from the use of unified convolution kernels in WaveNet to capture the dependencies of arbitrary waveform, the location-variable convolution uses convolution kernels with different coefficients to perform convolution operations on different waveform intervals, where the coefficients of kernels is predicted according to conditioning acoustic features, such as Mel-spectrograms. Based on location-variable convolutions, we design LVCNet for waveform generation, and apply it in Parallel WaveGAN to design more efficient vocoder. Experiments on the LJSpeech dataset show that our proposed model achieves a four-fold increase in synthesis speed compared to the original Parallel WaveGAN without any degradation in sound quality, which verifies the effectiveness of location-variable convolutions.

研究の動機と目的

  • リアルタイム音声合成における自己回帰的および標準的な非自己回帰的音声生成器の非効率性を解消すること。
  • 計算コストを低減しつつ、生波形生成における長期的時間的依存関係のモデル化を改善すること。
  • 高精細な音声品質を維持しながら推論を高速化できるより効率的な音声生成器アーキテクチャを設計すること。
  • 音声の文脈に基づいて波形の各区間ごとに変化する条件付きで適応的な畳み込みカーネルを検討すること。

提案手法

  • 位置可変畳み込み(LVC)を導入し、メルスペクトログラムに条件づけられたカーネル予測器を用いて、入力区間ごとにカーネル係数を動的に予測する。
  • LVCモジュールをParallel WaveGANフレームワーク内に適用し、標準的な拡大因果的畳み込みを、条件づけられた適応的カーネルに置き換える。
  • 局所的な条件特徴に基づいて、異なる時間区間に対して異なるカーネル重みを生成する別個のカーネル予測器ネットワークを採用する。
  • ゲート付き残差ブロック構造をWaveNetと同様に採用するが、標準的な畳み込みの代わりにLVCを用いることで、文脈に適応した特徴抽出を可能にする。
  • 音声品質を保つために、敵対的損失とマルチスケールディスクライマーを組み合わせてモデルを訓練する。
  • 適応的カーネル適応により、残差チャネル数を削減しながらも性能を維持することで、推論を最適化する。
Fig. 1 : An example of convolution process in the location-variable convolution. According to the conditioning sequence, the kernel predictor generates multiple sets of convolution kernels, which are used to perform convolution operations on the associated intervals in the input sequence. Each eleme
Fig. 1 : An example of convolution process in the location-variable convolution. According to the conditioning sequence, the kernel predictor generates multiple sets of convolution kernels, which are used to perform convolution operations on the associated intervals in the input sequence. Each eleme

実験結果

リサーチクエスチョン

  • RQ1条件づけられた適応的畳み込みカーネルは、音声品質を損なわせることなく波形生成の効率を向上させることができるか?
  • RQ2位置可変畳み込み機構は、固定カーネル畳み込みと比較して、生波形における長期的依存関係のモデル化においてどのように異なるか?
  • RQ3非自己回帰的音声生成器における残差チャネル数を減らす場合、適応的カーネル予測によってどの程度補えるか?
  • RQ4提案されたLVCNetは、Parallel WaveGANのような既存の非自己回帰的音声生成器よりも高速な推論速度を達成できるか?

主な発見

  • CPU上での合成速度は、元のParallel WaveGANと比較して4倍向上し、RTFは3.58から0.73に低下した。
  • 周囲の音声品質はほぼ同一で、MOSスコアは4.15±0.10を記録し、128の残差チャネルを用いた元のParallel WaveGANと同等の品質を維持した。
  • 残差チャネル数をわずか4に減らしても、MOSスコアは3.96±0.15を達成し、モデルの容量を削減しても安定性が保たれていることが示された。
  • NVIDIA V100 GPU上では、LVCNetは約300 MHzで音声を合成可能であり、Parallel WaveGANの35 MHzと比べて顕著に高速化された。
  • TTSシステムにおいて、LVCNetをTransformer TTSと組み合わせた場合、合成時間を15%短縮し、MOSスコアは同等の水準を維持した。
  • カーネル予測器により、パrameter数を減らしても長距離依存関係を効果的にモデル化でき、条件づけられたカーネル適応の有効性が裏付けられた。
(a) Architecture of LVCNet
(a) Architecture of LVCNet

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。