Skip to main content
QUICK REVIEW

[論文レビュー] A comparison of recent waveform generation and acoustic modeling methods for neural-network-based speech synthesis

Xin Wang, Jaime Lorenzo-Trueba|arXiv (Cornell University)|Apr 7, 2018
Speech Recognition and Synthesis参考文献 14被引用数 7
ひとこと要約

本論文は、大規模なクラウドソーシング評価を用いた統合TTSフレームワークにおいて、最近のニューラルネットワークベースの音声モデルとボコーダーを比較している。自動回帰(AR)音声モデルが標準のRNNとGANベースのポストフィルタを上回り、WaveNetボコーダーは従来のソース・フィルターボコーダーに比べて顕著に音声品質を向上させ、AR + WaveNetの組み合わせはほぼボコーディングされた音声品質に近い結果を得た。

ABSTRACT

Recent advances in speech synthesis suggest that limitations such as the lossy nature of the amplitude spectrum with minimum phase approximation and the over-smoothing effect in acoustic modeling can be overcome by using advanced machine learning approaches. In this paper, we build a framework in which we can fairly compare new vocoding and acoustic modeling techniques with conventional approaches by means of a large scale crowdsourced evaluation. Results on acoustic models showed that generative adversarial networks and an autoregressive (AR) model performed better than a normal recurrent network and the AR model performed best. Evaluation on vocoders by using the same AR acoustic model demonstrated that a Wavenet vocoder outperformed classical source-filter-based vocoders. Particularly, generated speech waveforms from the combination of AR acoustic model and Wavenet vocoder achieved a similar score of speech quality to vocoded speech.

研究の動機と目的

  • 現代のニューラルTTS部品を公平に比較する大規模な評価フレームワークを確立すること。
  • 特に自動回帰型およびGANベースのモデルを含む高度な音声モデリング技術が音声品質に与える影響を調査すること。
  • 特にWaveNetを含むディープラーニングベースのボコーダーが、古典的なソース・フィルターボコーダーと比較して果たす性能を評価すること。
  • 高精細音声合成に最も効果的な音声モデルとボコーダーの組み合わせを特定すること。
  • 波形位相モデリングおよび位相回復が知覚的品質に与える役割を分析すること。

提案手法

  • 標準のSPSSベースのバックエンドを用いた統合TTSパイプラインを構築し、フロントエンドおよびデュレーションモデリングを共有した。
  • 4つの音声モデルを比較:標準RNN、浅いAR-RNN(SAR)、およびRNNおよびSAR出力に適用された2つのGANベースのポストフィルタネットワーク(SGA、RGA)。
  • 4つのボコーダーを評価:WORLD、PML、WORLDを用いたGriffin-Lim、およびWaveNet;すべてがSARモデルからの同一の音声特徴を用いた。
  • 音声品質および話者の類似性は、235名の日本語話者を対象とした大規模なクラウドソーシングによる聴取テストで評価された。
  • 統計的分析には、無作為に選択されたt検定とHolm-Bonferroni補正を用い、システム間の平均スコアを比較した。
  • 周波数スペクトルおよび時間的特徴(例:グローバル分散、変調スペクトル)を分析し、知覚的差異を説明した。

実験結果

リサーチクエスチョン

  • RQ1自動回帰型およびGANベースの音声モデルは、標準RNNと比較して音声品質および自然さにおいてどのように異なるか?
  • RQ2WaveNetボコーダーは、WORLD や PML といった古典的なソース・フィルターボコーダーと比較して、知覚的品質で優れているか?
  • RQ3高度な音声モデルとWaveNetボコーダーの組み合わせにより、ボコーディングされた音声に近い音声品質が達成できるか?
  • RQ4従来のボコーダーを用いる場合、Griffin-Limによる位相回復が音声品質に与える影響は何か?
  • RQ5GANベースのポストフィルタがスペクトル詳細を改善しているにもかかわらず、なぜARモデルに劣る知覚的品質となるのか?

主な発見

  • 自動回帰(SAR)音声モデルは、全音声モデルの中で最高の音声品質スコア(3.03)を達成し、RNN(2.53)、SGA(2.82)、RGA(2.81)を有意に上回った。
  • RNNモデルは過剰に滑らかになる現象(オーバースムージング)を示しており、他のモデルと比較して生成されたMGC特徴のグローバル分散が低かった。
  • WaveNetボコーダーは、他のすべてのボコーダーを顕著に上回り、SAR-Waが最高の音声品質を得ており、一部のケースでは48 kHzボコーディング音声よりも良いと評価された。
  • SAR音声モデルとWaveNetボコーダーの組み合わせにより、ボコーディング音声に非常に近い音声品質が得られ、ほぼ理想に近い性能であることが示された。
  • Griffin-Limによる位相回復は品質向上に寄与せず、逆にアーティファクトを生じさせる可能性があり、SAR-PrとSAR-Woの間でスコアに有意な差が認められなかった。
  • GANベースのポストフィルタ(SGA、RGA)はスペクトル詳細およびグローバル分散を改善したが、アーティファクトを増加させ、スペクトル特徴が優れているにもかかわらず、ARモデルに比べて知覚的品質が低かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。