Skip to main content
QUICK REVIEW

[論文レビュー] TFGAN: Time and Frequency Domain Based Generative Adversarial Network for High-fidelity Speech Synthesis

Qiao Tian, Yi Chen|arXiv (Cornell University)|Nov 24, 2020
Speech Recognition and Synthesis参考文献 20被引用数 22
ひとこと要約

TFGANは、MelGANを拡張して高精細音声合成のための時間領域および周波数領域の敵対的生成モデルを提案する。ResNet18ベースの周波数領域識別器と、金属音を低減し位相整合性を向上させる複数の時間領域波形損失を導入することで、MelGANに匹敵する推論速度を維持しながら、自己回帰的WaveRNNと同等の品質を達成する。MOSは4.35 ± 0.04を記録し、MelGANを上回り、WaveRNNに近い品質を実現した。

ABSTRACT

Recently, GAN based speech synthesis methods, such as MelGAN, have become very popular. Compared to conventional autoregressive based methods, parallel structures based generators make waveform generation process fast and stable. However, the quality of generated speech by autoregressive based neural vocoders, such as WaveRNN, is still higher than GAN. To address this issue, we propose a novel vocoder model: TFGAN, which is adversarially learned both in time and frequency domain. On one hand, we propose to discriminate ground-truth waveform from synthetic one in frequency domain for offering more consistency guarantees instead of only in time domain. On the other hand, in contrast to the conventionally frequency-domain STFT loss approach or feature map loss by discriminator to learn waveform, we propose a set of time-domain loss that encourage the generator to capture the waveform directly. TFGAN has nearly same synthesis speed as MelGAN, but the fidelity is significantly improved by our novel learning method. In our experiments, TFGAN shows the ability to achieve comparable mean opinion score (MOS) than autoregressive vocoder under speech synthesis context.

研究の動機と目的

  • MelGANのような非自己回帰的GANベース音声変換器において、長年の金属音および位相関連のアーティファクト問題に対処すること。
  • 時間領域および周波数領域での敵対的訓練を可能にすることで波形忠実度を向上させ、聴覚的品質を向上させること。
  • STFT損失に依存するのを減らすために、直接的に時間領域波形損失を導入し、生成器の監視を強化すること。
  • MelGANの高速推論速度を維持しながら、WaveRNNのような自己回帰的モデルと同等の品質を達成すること。
  • 位相およびスペクトル整合性をよりよく捉えることができる、より強力な識別器アーキテクチャを設計すること。

提案手法

  • STFTマグニチュードおよび位相領域で本物の音声と生成された音声を評価する、ResNet18ベースの周波数領域識別器を導入し、位相整合性を向上させる。
  • 生成器に直接的に時間領域波形損失(例:L1、L2)を導入することで、原始音声に直接的に監視を施し、STFTに基づく損失に過度に依存するのを防ぐ。
  • 転置畳み込みアップサンプリング層を変更し、最近傍補間を統合することで、発話領域における周期的アーティファクトを抑制する。
  • Multi-band MelGANと同様に、異なるスケールでのストライド畳み込みを用いたマルチスケール時間領域識別器を採用し、局所的およびグローバルな音声構造を捉える。
  • 敵対的損失に加え、特徴マッチングとマルチリゾリューションSTFT損失を組み合わせることで、学習の安定化とスペクトル忠実度の向上を実現する。
  • 時間領域と周波数領域の両方の識別器を備えたデュアル識別器構造を採用し、生成器とともにエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1時間領域および周波数領域での敵対的訓練が、非自己回帰的音声変換器の聴覚的品質を顕著に向上させることができるか?
  • RQ2直接的な時間領域波形損失を導入することで、STFT損失に依存するのみの状態と比較して、金属音を低減し、位相整合性を向上させることができるか?
  • RQ3ResNet18ベースの周波数領域識別器は、時間領域のみの識別器よりも、スペクトルおよび位相特性をよりよく捉えることができるか?
  • RQ4変更されたアップサンプリング機構は、特に発話領域において周期的アーティファクトをどれほど低減できるか?
  • RQ5GANベースの音声変換器は、MelGANレベルの推論速度を維持しながら、WaveRNNのような自己回帰的モデルと同等のMOSを達成できるか?

主な発見

  • TFGANは平均意見評価(MOS)を4.35 ± 0.04で達成し、MelGAN(3.95 ± 0.05)を上回り、自己回帰的Multi-band WaveRNN(4.34 ± 0.04)と同等の品質を実現した。
  • アブレーションスタディの結果、時間領域損失と向上したアップサンプリングの組み合わせにより、PESQがベースラインの2.77から3.24に向上し、WaveRNNの3.02を上回った。
  • 周波数領域識別器は位相整合性に顕著な貢献をし、金属音および人工的な聴覚的アーティファクトを低減した。
  • 変更されたアップサンプリング機構は、息遣いおよび発話領域における周期的アーティファクトを効果的に低減し、客観的指標でも確認された。
  • TFGANはMelGANと同等の推論速度を維持し、単一GPU上でリアルタイム要因(RTF)約0.01を達成した。
  • STOIは0.95、PESQは3.24を達成し、両方の指標でMelGANおよびWaveRNNを上回った。PESQはWaveRNNを0.22ポイント上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。