[論文レビュー] WaveCycleGAN2: Time-domain Neural Post-filter for Speech Waveform Generation
WaveCycleGAN2 は、ダウンサンプリング/アップサンプリングモジュールを削除し、波形と音声パラメータの判別器を組み合わせることでアリアイジングを回避する時間領域におけるニューラルポストフィルタを提案する。1枚のGPUで150 kHzを超える速度で音声を処理しながら、WaveNet や WaveGlow と同等の自然さスコアを達成する。
WaveCycleGAN has recently been proposed to bridge the gap between natural and synthesized speech waveforms in statistical parametric speech synthesis and provides fast inference with a moving average model rather than an autoregressive model and high-quality speech synthesis with the adversarial training. However, the human ear can still distinguish the processed speech waveforms from natural ones. One possible cause of this distinguishability is the aliasing observed in the processed speech waveform via down/up-sampling modules. To solve the aliasing and provide higher quality speech synthesis, we propose WaveCycleGAN2, which 1) uses generators without down/up-sampling modules and 2) combines discriminators of the waveform domain and acoustic parameter domain. The results show that the proposed method 1) alleviates the aliasing well, 2) is useful for both speech waveforms generated by analysis-and-synthesis and statistical parametric speech synthesis, and 3) achieves a mean opinion score comparable to those of natural speech and speech synthesized by WaveNet (open WaveNet) and WaveGlow while processing speech samples at a rate of more than 150 kHz on an NVIDIA Tesla P100.
研究の動機と目的
- 音声波形の自然さと合成波形の間の持続的なギャップ、特に音声生成アーティファクトと位相の曖昧さによる影響を解消すること。
- 従来の WaveCycleGAN モデルで生じるダウンサンプリング/アップサンプリングモジュールに起因するアリアイジング歪みを克服すること。
- アナリシス&シンセシスおよび統計的パrametric音声合成パイプラインの両方における音声品質を向上させること。
- 推論速度を150 kHz以上に保ちながら、最先端の自己回帰的およびフローベースの音声生成器と同等の知覚的品質を維持すること。
- 並列学習データを必要とせず、時間領域におけるサイクル整合性のある敵対的学習を活用することで高精細な音声変換を達成すること。
提案手法
- ダウンサンプリング/アップサンプリングレイヤーを一切含まない完全畳み込み型ジェネレータアーキテクチャを提案し、アリアイジングアーティファクトを排除する。
- デュアル判別器構成を導入:1つは生波形上で動作し、もう1つは音声パラメータ(メルスペクトログ램、メルケプストラム、位相スペクトル)上で動作する。
- ペアドデータを必要としない合成波形から自然波形へのマッピングを学習するためにサイクル整合性のある敵対的学習を採用する。
- 波形ドメインの判別器により微細な時間的詳細を保持し、音声パラメータ判別器によりスペクトル特性を整合させる。
- ペアド(V2msp paired)およびアンパイルド(V2msp unpaired)の両設定でモデルを学習し、多様な入力条件における汎化性を向上させる。
- サイクル整合性学習の位相の曖昧さに対する不変性を活用し、学習中に無音または損傷のある出力を回避する。
実験結果
リサーチクエスチョン
- RQ1ジェネレータアーキテクチャからダウンサンプリング/アップサンプリングモジュールを削除することで、ポストフィルタド波形におけるアリアイジングを顕著に低減できるか?
- RQ2波形ドメインと音声パラメータドメインの両方で判別器を組み合わせることで、知覚的品質と汎化性が向上するか?
- RQ3提案手法は、WaveNet や WaveGlow と同等の自然さスコアを達成しながらも、高速推論を維持できるか?
- RQ4アナリシス&シンセシスおよび統計的パrametric音声合成パイプラインの両方において、モデルの性能はどの程度か?
- RQ5並列データを必要としないアンパイルド学習設定(V2msp unpaired)は、ペアド設定と同等の音声品質と耐性を達成できるか?
主な発見
- WaveCycleGAN2 はジェネレータアーキテクチャからダウンサンプリング/アップサンプリングモジュールを削除することで、顕著にアリアイジングアーティファクトを低減した。
- LJSpeech データセットにおけるペアド設定では、平均意見スコア(MOS)が 4.023 ± 0.124 を達成し、オープンソース WaveNet(3.657 ± 0.162)と WaveGlow(3.443 ± 0.164)を上回った。
- LJSpeech データセットでは、V2msp(ペアド)が対数スペクトル歪み(LSD)4.318 dB を達成し、WaveGlow(4.540 dB)とオープンソース WaveNet(4.971 dB)を上回った。
- アンパイルド学習バージョン(V2msp unpaired)は MOS 3.833 ± 0.127 を達成し、並列データがなくても強力な汎化性を示した。
- モデルは NVIDIA Tesla P100 で 150 kHz を超える速度で音声を処理でき、実時間推論が可能で、実装に適した性能を示した。
- 主観的評価では、WaveGlow で見られる一般的なアーティファクト(例:プリエコー)やオープンソース WaveNet でのアーティファクト(例:コラプス)が WaveCycleGAN2 で低減されたが、WORLD ヴォコーダのフォーリング検出エラーに起因する一部のアーティファクトは依然として残存していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。