[論文レビュー] LP-WaveNet: Linear Prediction-based WaveNet Speech Synthesis
本稿では、混合密度ネットワーク内で音声エキサイテーションと線形予測(LP)フィルタ応答を同時にモデル化することで、音声合成品質を向上させるWaveNetベースのニューラルボコーダー、LP-WaveNetを提案する。残差エキサイテーションをモデル化すると同時にLP合成制約を組み込むことで、スペクトルの不一致やノイズアーチファクトを低減し、TTS評価で4.47のMOSを達成した。これは従来のWaveNetボコーダーを著しく上回っている。
We propose a linear prediction (LP)-based waveform generation method via WaveNet vocoding framework. A WaveNet-based neural vocoder has significantly improved the quality of parametric text-to-speech (TTS) systems. However, it is challenging to effectively train the neural vocoder when the target database contains massive amount of acoustical information such as prosody, style or expressiveness. As a solution, the approaches that only generate the vocal source component by a neural vocoder have been proposed. However, they tend to generate synthetic noise because the vocal source component is independently handled without considering the entire speech production process; where it is inevitable to come up with a mismatch between vocal source and vocal tract filter. To address this problem, we propose an LP-WaveNet vocoder, where the complicated interactions between vocal source and vocal tract components are jointly trained within a mixture density network-based WaveNet model. The experimental results verify that the proposed system outperforms the conventional WaveNet vocoders both objectively and subjectively. In particular, the proposed method achieves 4.47 MOS within the TTS framework.
研究の動機と目的
- 大規模かつ多様な音声データベースにおいて、高いプロソディックおよび表現的可変性を示す音声を学習する際の課題に対処すること。
- 独立したエキサイテーションモデル化に起因する、WaveNetベースの音声合成におけるスペクトルの不一致とノイズアーチファクトを低減すること。
- 声の発声プロセスの物理的側面、特に声源と声道の相互作用をWaveNetの学習目的に組み込むことで、知覚的品質を向上させること。
- LP合成フィルタリングを生成モデルに埋め込むことで、より安定的かつ高精細な波形生成を可能にすること。
提案手法
- LP-WaveNetは、予測されたエキサイテーション平均と過去の音声サンプルのLP近似を組み合わせる混合密度ネットワーク(MDN)を用いて、音声信号の分布をモデル化する。
- モデルは過去の音声サンプルとLP係数に条件付けられ、生成された信号がLP合成フィルタのダイナミクスを尊重することを保証する。
- エキサイテーション成分はWaveNetによって自己回帰的にモデル化され、LP近似は過去のサンプルをLP係数で重み付けした線形結合として計算される。
- ターゲット分布はMDN平均とLP近似の和として定義され、エキサイテーションとスペクトルエンVELOープの共同学習を可能にする。
- 粗い量子化を回避するため、残差信号をモデル化することで、標準WaveNetで一般的なノイズアーチファクトを低減する。
- フレームワークは、複雑なスペクトルモデリングをLP近似に移譲することで、効率的な学習を可能にし、WaveNetはエキサイテーション予測に集中する。
実験結果
リサーチクエスチョン
- RQ1エキサイテーションとLP合成フィルタの共同モデリングは、独立したエキサイテーションモデリングと比較して音声合成品質を向上させることができるか?
- RQ2WaveNetの学習目的にLP合成プロセスを組み込むことで、スペクトルの不一致とノイズアーチファクトが低減するか?
- RQ3標準WaveNetおよびエキサイテーション専用WaveNetボコーダーと比較して、LP-WaveNetは客観的指標および主観的MOSにおいてどのように性能を発揮するか?
- RQ4音声特徴がTTSシステムによって予測される場合(つまり、特徴予測誤差がある場合)でも、提案手法は高い品質を維持できるか?
- RQ5A-B preferenceテストにおいて、LP-WaveNetの知覚的品質はベースラインWaveNetボコーダーを著しく上回っているか?
主な発見
- LP-WaveNetはTTSフレームワークで平均意見評価(MOS)4.47を達成し、次に優れたシステム(4.04)を著しく上回り、自然音声(4.75 MOS)に近づいた。
- A/SシステムではLP-WaveNetが4.58 MOSを達成し、自然音声よりわずか0.17ポイント低い水準にあり、ほぼ自然音声に近い品質を示した。
- A-B preferenceテストでは、すべてのテスト条件下でLP-WaveNetがWN_SおよびWN_Eを著しく好まれた(p < 10^-4)、複数の比較で80%を超える好まれ率を示した。
- 客観的指標では、LP-WaveNetはVUV誤差、F0 RMSE、LSD、F-LSDのすべての指標で、従来のWaveNetボコーダーを上回った。
- TTSシステムにおける音声特徴予測誤差が生じても、LP-WaveNetは優れた性能を維持し、特徴劣化に対して頑健であることが示された。
- MDNフレームワーク内でエキサイテーションとLPフィルタの相互作用を共同でモデル化することで、ノイズアーチファクトとスペクトルの不一致が効果的に低減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。