Skip to main content
QUICK REVIEW

[論文レビュー] High-quality Speech Synthesis Using Super-resolution Mel-Spectrogram

Leyuan Sheng, Dongyan Huang|arXiv (Cornell University)|Dec 3, 2019
Speech and Audio Processing参考文献 20被引用数 10
ひとこと要約

本論文では、Pix2PixHDとResUnetアーキテクチャを組み合わせた条件付きGANベースのフレームワークを用いて、低品質なTTS生成メルスペクトログラムを高品質に向上させるスーパーサンプリングメルスペクトログラムモデルを提案する。メルスペクトログラムを画像とみなすことにより、微細な音響的詳細を再構築し、Griffin-Limを用いた場合にベースライン比で0.44のMOS向上、WaveNetを用いた場合に0.17の向上を達成し、真値に近い品質に近づいた。

ABSTRACT

In speech synthesis and speech enhancement systems, melspectrograms need to be precise in acoustic representations. However, the generated spectrograms are over-smooth, that could not produce high quality synthesized speech. Inspired by image-to-image translation, we address this problem by using a learning-based post filter combining Pix2PixHD and ResUnet to reconstruct the mel-spectrograms together with super-resolution. From the resulting super-resolution spectrogram networks, we can generate enhanced spectrograms to produce high quality synthesized speech. Our proposed model achieves improved mean opinion scores (MOS) of 3.71 and 4.01 over baseline results of 3.29 and 3.84, while using vocoder Griffin-Lim and WaveNet, respectively.

研究の動機と目的

  • 生成されたメルスペクトログラムに見られる過剰に滑らかすぎる問題が合成音声品質を低下させることを是正すること。
  • Tacotron2のようなエンドツーエンドTTSモデルが生成するメルスペクトログラムの忠実度を向上させること。
  • メルスペクトログラムを画像とみなすことにより、画像対画像変換技術を活用して音声信号を強化すること。
  • 深層学習を用いて詳細なスペクトログラム構造を再構築することで、高品質な音声合成を達成すること。
  • 強化されたメルスペクトログラム予測により、合成音声と真値音声の差を縮小すること。

提案手法

  • モデルはPix2PixHDに基づく条件付きGANフレームワークを採用し、粗いから細かい段階の生成器と複数スケールの識別器を組み合わせる。
  • Pix2PixHDの元の生成器に代わり、ResUnetに基づくローカルエナブラーネットワークを導入し、特徴の再構築と詳細回復を向上させる。
  • 生成器はスキップ接続と残差ブロックを採用し、スーパーサンプリング中に微細なスペクトログラム詳細を保持する。
  • 訓練には、複数スケールでの敵対的損失と特徴一致損失を組み合わせた損失関数を用い、訓練の安定化を図る。
  • Adam最適化アルゴリズムを用い、学習率の段階的低下を適用して、13,000組の粗いと元のメルスペクトログラムのペアでモデルを学習する。
  • 強化されたメルスペクトログラムは、評価のため、Griffin-LimおよびWaveNet音声生成器(ボコーダ)を用いて波形に変換される。

実験結果

リサーチクエスチョン

  • RQ1画像対画像変換モデルは、低品質なTTS出力から高精細なメルスペクトログラムを効果的に再構築できるか?
  • RQ2Pix2PixHDとResUnetに基づくスーパーサンプリングモデルは、ベースラインTTSシステムに比べて、微細なスペクトログラム詳細をどの程度回復できるか?
  • RQ3強化されたメルスペクトログラムは、MOSや客観的指標で測定した場合、どの程度音声品質を向上させるか?
  • RQ4提案手法は、さまざまなボコーダで合成音声と真値音声の差を縮小するか?
  • RQ5Griffin-LimやWaveNetのような異なるボコーダに対しても、モデルは一般化可能で、高品質な知覚的品質を維持できるか?

主な発見

  • 提案モデルは、Griffin-Limを用いた場合にMOS 3.73、WaveNetを用いた場合にMOS 4.01を達成し、それぞれベースラインの3.29および3.84に対して顕著な向上を示した。
  • 予測されたメルスペクトログラムのSSIM値は0.920に達し、元の値の1.00に近く、高い構造的類似性を示した。
  • STOIスコアは、ベースラインの0.791から、Griffin-Limを用いた場合に0.978、WaveNetを用いた場合に0.919に向上し、音声の聞き取りやすさが向上した。
  • 図4による視覚的確認により、粗いメルスペクトログラムに欠落していた高調波成分やトランジェント構造が効果的に回復された。
  • MOSの結果から、強化された音声が元の音声に知覚的に近いことが示され、Griffin-Limを用いた場合に0.44の向上、WaveNetを用いた場合に0.17の向上を達成した。
  • モデルの性能はさまざまなボコーダで安定しており、音声合成における一般化能力が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。