[論文レビュー] Statistical Parametric Speech Synthesis Incorporating Generative Adversarial Networks
本稿では、自然音声と生成音声の間の分布的乖離を最小化することで、合成音声パラメータの過剰平滑化を低減するGANベースの学習フレームワークを提案する。本手法では、識別器を用いて本物のパラメータと合成パラメータを区別するように、音声特徴モデルを同時に学習することで、テキスト音声合成およびボイスコンバージョンの両方でスペクトルおよびF0の自然さが向上する。特に、Wasserstein GANがハイパーパrameter設定にかかわらず最高の音声品質を達成した。
A method for statistical parametric speech synthesis incorporating generative adversarial networks (GANs) is proposed. Although powerful deep neural networks (DNNs) techniques can be applied to artificially synthesize speech waveform, the synthetic speech quality is low compared with that of natural speech. One of the issues causing the quality degradation is an over-smoothing effect often observed in the generated speech parameters. A GAN introduced in this paper consists of two neural networks: a discriminator to distinguish natural and generated samples, and a generator to deceive the discriminator. In the proposed framework incorporating the GANs, the discriminator is trained to distinguish natural and generated speech parameters, while the acoustic models are trained to minimize the weighted sum of the conventional minimum generation loss and an adversarial loss for deceiving the discriminator. Since the objective of the GANs is to minimize the divergence (i.e., distribution difference) between the natural and generated speech parameters, the proposed method effectively alleviates the over-smoothing effect on the generated speech parameters. We evaluated the effectiveness for text-to-speech and voice conversion, and found that the proposed method can generate more natural spectral parameters and $F_0$ than conventional minimum generation error training algorithm regardless its hyper-parameter settings. Furthermore, we investigated the effect of the divergence of various GANs, and found that a Wasserstein GAN minimizing the Earth-Mover's distance works the best in terms of improving synthetic speech quality.
研究の動機と目的
- 深層ニューラルネットワークに基づく統計的パrametric音声合成における過剰平滑化効果を是正し、合成音声品質の低下を是正すること。
- 特にスペクトルおよびF0特徴において、自然音声と生成音声のパラメータ間の分布的類似性を向上させること。
- グローバル分散や変調スペクトルなどの統計的特徴を明示的にモデル化しない汎用的な学習フレームワークを構築すること。
- テキスト音声合成およびボイスコンバージョンの両タスクにおいて、さまざまなGANバリアントの音声品質向上効果を評価すること。
- 異なる乖離測度が合成音声品質最適化に与える役割を調査すること。
提案手法
- 識別器が本物の音声パラメータと生成されたパラメータを区別するGANフレームワークを導入し、生成器(音声特徴モデル)を識別器を欺くように学習させる。
- 生成誤差最小化(MGE)損失と敵対的損失の重み付き和を用いて音声特徴モデルを学習し、生成誤差と分布的乖離の両方を最小化する。
- 識別器は、データセットから得た本物の音声パラメータと、音声特徴モデルから得た生成パラメータを分類するように学習され、現実的なパラメータ分布の促進が図られる。
- グローバル分散や変調スペクトルなどの明示的特徴工学を伴わずに、音声パラメータ内の複雑な統計的依存関係を暗黙的にモデル化する。
- W-GAN(地球移動距離を最小化)、LS-GAN、f-GAN、JS-GANなどのさまざまなGANバリアントを評価し、音声品質に与える影響を比較する。
- フレームワークは、テキスト音声合成およびボイスコンバージョンの両方のタスクに適用され、共通の学習手順と評価プロトコルが採用されている。
実験結果
リサーチクエスチョン
- RQ1GANフレームワークを用いた敵対的学習は、合成音声パラメータの過剰平滑化を効果的に低減できるか?
- RQ2乖離測度の選択(例:W-GAN対JS-GAN)が、合成音声の主観的品質にどのように影響するか?
- RQ3提案されたGANベースの学習は、テキスト音声合成およびボイスコンバージョンの両タスクで音声品質を向上させるか?
- RQ4識別器は、合成音声を検出するための反スプーフィング機構として機能できるか?その影響は学習にどのように現れるか?
- RQ5明示的な統計的特徴モデリング(例:GV、MS)に比べて、GANベースの手法は音声の自然さ向上に優れているか?
主な発見
- 提案手法は、すべてのハイパーパrameter設定において、テキスト音声合成およびボイスコンバージョンの両方で顕著に音声品質を向上させ、MOSスコアが上昇した。
- 地球移動距離を最小化するWasserstein GAN(W-GAN)が、LS-GAN、JS-GAN、KL-GANを上回り、最高の主観的音声品質を達成した。
- KL-GANは品質向上に寄与しなかったが、逆方向のKL-GAN(RKL-GAN)は向上を示した。これは非対称な乖離測度が予想に反する効果を示す可能性があることを示唆している。
- JS-GANは性能が低かったが、シグモイド活性化関数を用いた近似版GANはより良い結果を示した。これは近似の安定性が重要である可能性を示している。
- 本手法はグローバル分散やパラメータ間相関を効果的に補償し、スペクトルおよびF0の自然さの両方を向上させた。
- 好みテストの結果、本手法はボイスコンバージョンにおける音声品質および発話者個性の再現性において、従来のMGE学習を上回ることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。