Skip to main content
QUICK REVIEW

[論文レビュー] Statistical Parametric Speech Synthesis Using Generative Adversarial Networks Under A Multi-task Learning Framework

Shan Yang, Lei Xie|arXiv (Cornell University)|Jul 6, 2017
Speech Recognition and Synthesis参考文献 30被引用数 6
ひとこと要約

本稿では、統計的パrametric音声合成(SPSS)における生成的対抗ネットワーク(GAN)と平均二乗誤差(MSE)損失を組み合わせたマルチタスク学習フレームワークを提案する。GANの識別器を共同で最適化することで音声の聴取品質を向上させるとともに、MSE損失を用いて学習の安定性を確保することで、ベースラインシステムに比べてより自然な音声を生成する。主観的聴取テストでも顕著な改善が確認された。

ABSTRACT

In this paper, we aim at improving the performance of synthesized speech in statistical parametric speech synthesis (SPSS) based on a generative adversarial network (GAN). In particular, we propose a novel architecture combining the traditional acoustic loss function and the GAN's discriminative loss under a multi-task learning (MTL) framework. The mean squared error (MSE) is usually used to estimate the parameters of deep neural networks, which only considers the numerical difference between the raw audio and the synthesized one. To mitigate this problem, we introduce the GAN as a second task to determine if the input is a natural speech with specific conditions. In this MTL framework, the MSE optimization improves the stability of GAN, and at the same time GAN produces samples with a distribution closer to natural speech. Listening tests show that the multi-task architecture can generate more natural speech that satisfies human perception than the conventional methods.

研究の動機と目的

  • 統計的パrametric音声合成(SPSS)における知覚的欠陥を解消する。具体的には、数値的損失(例:MSE)を最小化しても人間の知覚が向上しないという問題に取り組む。
  • GANベースの音声合成で一般的に見られる不安定性やモード崩壊の問題を、従来のMSE損失関数を統合することで軽減する。
  • 識別器が本物の音声と合成音声の知覚的差を捉える能力を活用することで、音声の自然さを向上させる。
  • マルチタスク学習(MTL)フレームワークが、同時に学習の安定性を確保するとともに知覚的品質を向上させられるかどうかを検証する。
  • GANベースの生成が、客観的および主観的指標の両方において、標準のBLSTMベースのTTSおよび他のGANバージョンを上回るかを評価する。

提案手法

  • 生成器(音声特徴モデル)が平均二乗誤差(MSE)損失とGANの敵対的損失の両方で学習されるマルチタスク学習の枠組みを採用する。
  • 生成器は言語的特徴を条件として音声パramータを生成し、識別器は生成された音声が本物か合成品かを評価することで、知覚的品質の向上に向けたフィードバックを提供する。
  • MSE損失は数値的安定性を確保し、生成器がターゲット音声特徴の正確な再構成に向かうように導くことで、モード崩壊の防止に寄与する。
  • GAN損失は声質合成器(ボコーダ)の出力に適用され、識別器が自然音声波形と合成音声波形の知覚的差を学習できるようにする。
  • 言語的特徴を条件として用いることで、合成過程でコンテンツとイントネーションが保持されるようにする。
  • 学習プロセスは、生成器のMSEおよび敵対的目的の最適化を交互に実行し、識別器は本物のサンプルと生成されたサンプルを区別できるように更新する。

実験結果

リサーチクエスチョン

  • RQ1マルチタスク学習フレームワークにおいて、GANと従来のMSE損失を組み合わせることで、SPSSにおける合成音声の知覚的品質が向上するか?
  • RQ2GANの識別器を組み込むことで、より自然なイントネーションが得られ、『ざらついた』音などの知覚的アーティファクトが減少するか?
  • RQ3MTLフレームワークは、GANベースの音声合成で一般的に見られる不安定性やモード崩壊の問題をどのように軽減するか?
  • RQ4主観的聴取テストにおいて、GANベースのアプローチがベースラインのBLSTMベースTTSおよび他のGANバージョンを上回るか?
  • RQ5本物対合成音声を区別する識別器は、反スプーフィング(ASV)などの補助タスクで学習された識別器よりも効果的か?

主な発見

  • 提案されたMTLフレームワークは、ベースラインのBLSTMベースTTSに比べて顕著に優れた主観的音声品質を達成した。A/B好みテストではp値 < 0.0001であった。
  • 聴取者たちはGANベースのシステムをASVベースの方法よりも好んだ。これは、GANの識別器が音声品質の知覚的差をより適切に捉えていることを示している。
  • GANベースのシステムは、特に最初の数個のメルケプストラム係数において、自然音声に近いグローバル分散(GV)値を示し、スペクトルエンVELOPのモデリングが改善されたことを示した。
  • 発音分類を識別器の入力として用いたGAN-PCバージョンは顕著な性能低下(p < 0.001)を示した。これは、識別器に言語的条件を組み込むと知覚的品質が損なわれる可能性があることを示唆している。
  • 直接比較においてBLSTMシステムはGAN-PCをわずかに上回った(p = 0.0253)。これは、識別器に発音ラベルを追加することは知覚的品質向上にとって逆効果であることを確認している。
  • フレームワークはベースラインと同等の客観的損失値を維持した。これは、性能向上が数値的最適化によるものではなく、知覚的利点に起因していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。