[論文レビュー] Effective parameter estimation methods for an ExcitNet model in generative text-to-speech systems
本稿では、Tacotron 2に基づくシーケンス・ツー・シーケンス音声モデルとExcitNet音声生成器を組み合わせることで、スペクトルおよび励振パラメータ推定を向上させた高品質な生成型音声合成システムを提案する。この手法は、感情表現音声においてそれぞれ4.67(喜び)および4.43(悲しみ)のMOSスコアを達成し、WaveNetベースのシステムおよび先行のパrametric TTSシステムを著しく上回る優れた聴取品質を実現した。
In this paper, we propose a high-quality generative text-to-speech (TTS) system using an effective spectrum and excitation estimation method. Our previous research verified the effectiveness of the ExcitNet-based speech generation model in a parametric TTS framework. However, the challenge remains to build a high-quality speech synthesis system because auxiliary conditional features estimated by a simple deep neural network often contain large prediction errors, and the errors are inevitably propagated throughout the autoregressive generation process of the ExcitNet vocoder. To generate more natural speech signals, we exploited a sequence-to-sequence (seq2seq) acoustic model with an attention-based generative network (e.g., Tacotron 2) to estimate the condition parameters of the ExcitNet vocoder. Because the seq2seq acoustic model accurately estimates spectral parameters, and because the ExcitNet model effectively generates the corresponding time-domain excitation signals, combining these two models can synthesize natural speech signals. Furthermore, we verified the merit of the proposed method in producing expressive speech segments by adopting a global style token-based emotion embedding method. The experimental results confirmed that the proposed system significantly outperforms the systems with a similarly configured conventional WaveNet vocoder and our best prior parametric TTS counterpart.
研究の動機と目的
- 従来の深層ニューラルネットワークによるスペクトルおよび励振パラメータ推定の不正確さが引き起こす誤差伝播の問題を解決すること。
- 注意機構を備えたシーケンス・ツー・シーケンスモデルを活用し、より正確な音声特徴推定を行うことで、生成型音声合成の聴取品質を向上させること。
- グローバルスタイルトークン(GST)を統合することで、感情に配慮したプロソディーのモデリングを可能にし、表現音声合成を実現すること。
- ExcitNetが強力な音声推定器と組み合わされると、従来のWaveNet音声生成器および先行のパrametric TTSシステムを上回ることを実証すること。
提案手法
- 位置に敏感な注意機構を備えたシーケンス・ツー・シーケンス型Tacotron 2スタイルのモデルを用い、ExcitNet音声生成器のためのスペクトルおよび励振パラメータを推定する。
- 音声モデルはテキストシーケンスを埋め込み表現に変換し、自己回帰的デコード中にターゲット音声特徴とアライメントをとるための注意機構を用いる。
- ExcitNetは、線形予測(LP)フィルタをかけた音声信号の残差を、WaveNetベースのアーキテクチャでモデル化することで、時間領域の励振信号を生成する。
- LPフィルタは推定されたスペクトルパラメータを用いて、生成された励振信号から音声信号を再構築する。
- グローバルスタイルトークン(GST)ネットワークを統合し、感情固有のプロソディック埋め込みを学習させ、これをトランスクリプト埋め込みと連結することでデコーダーを条件づける。
- GSTネットワークは6層の2次元畳み込みニューラルネットワーク(2D-CNN)とGRUを用い、10個のスタイルトークンと4ヘッドのアテンションを活用して高次元の感情埋め込みを抽出する。
実験結果
リサーチクエスチョン
- RQ1注意機構を備えたシーケンス・ツー・シーケンス音声モデルは、従来のDNNと比較して、ExcitNetのためのスペクトルおよび励振パラメータ推定の正確性を向上させることができるか?
- RQ2Tacotron 2とExcitNetを組み合わせた場合、同じ音声推定器を用いたWaveNet音声生成器と比較して、より高い聴取品質が得られるか?
- RQ3グローバルスタイルトークンの統合は、ExcitNetフレームワークにおける表現音声合成にどの程度の向上効果をもたらすか?
- RQ4本手法は、自然さと表現力の観点から、感情表現音声合成においてどの程度の性能を示すか?
主な発見
- 提案手法は、喜びの感情表現音声において平均意見スコア(MOS)4.67 ± 0.05、悲しみの感情表現音声において4.43 ± 0.09を達成し、WaveNetベースのベースラインを著しく上回った。
- ExcitNetベースのシステムのMOSは、それぞれ喜びで4.67、悲しみで4.43であり、従来のWaveNet音声生成器(それぞれ4.27および4.09)と比較して優れた聴取品質を示した。
- ExcitNet音声生成器とGSTベースの感情モデリングを組み合わせたシステムは、特にプロソディーと感情の自然さの観点で、表現音声合成の向上が顕著に見られた。
- 提案手法は、最も優れた先行パrametric TTSシステムを著しく上回り、正確なパラメータ推定とニューラル音声生成器の組み合わせの有効性を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。