[論文レビュー] A Deep Learning Approach to Data-driven Parameterizations for Statistical Parametric Speech Synthesis
本稿では、メルログスペクトルの可逆的で次元が低く、ノイズに強く、学習可能な表現を学習するため、テーパードされたスタックドノイズ除去オートエノード(SDA)を用いたデータ駆動型、ディープラーニングベースのパrameterizationを提案する。SDAはアンラップされ、マルチレイヤーパーセプトロン(MLP)を用いて微調整され、その後エンコーディングとデコーディングのネットワークに分割される。本手法は、競争力のあるMCDスコア(3.827)を達成し、学習された表現が補間可能な空間に位置することを示しており、音声合成のパrameterizationに必要なすべての主要な要件を満たしている。
Nearly all Statistical Parametric Speech Synthesizers today use Mel Cepstral coefficients as the vocal tract parameterization of the speech signal. Mel Cepstral coefficients were never intended to work in a parametric speech synthesis framework, but as yet, there has been little success in creating a better parameterization that is more suited to synthesis. In this paper, we use deep learning algorithms to investigate a data-driven parameterization technique that is designed for the specific requirements of synthesis. We create an invertible, low-dimensional, noise-robust encoding of the Mel Log Spectrum by training a tapered Stacked Denoising Autoencoder (SDA). This SDA is then unwrapped and used as the initialization for a Multi-Layer Perceptron (MLP). The MLP is fine-tuned by training it to reconstruct the input at the output layer. This MLP is then split down the middle to form encoding and decoding networks. These networks produce a parameterization of the Mel Log Spectrum that is intended to better fulfill the requirements of synthesis. Results are reported for experiments conducted using this resulting parameterization with the ClusterGen speech synthesizer.
研究の動機と目的
- メルケプストラル係数(MCEPs)が長年にわたり標準的であるものの、既知の欠陥を抱える統計的パrametric音声合成における長年の限界を解消すること。
- 可逆性、ノイズ耐性、次元の低さ、補間可能性という4つの主要な要件を満たすデータ駆動型パrameterizationを開発すること。
- ディープラーニングが、MCEPsのような手作業で設計されたパrameterizationよりも優れたスペクトル表現を発見できるかを検討すること。
- 本手法を実世界の合成器(ClusterGen)で評価し、MCEPベースラインと定量的・定性的に比較すること。
提案手法
- ノイズ注入を用いて入力を破損させたバージョンの再構築を学習するように、メルログスペクトル特徴量上でスタックドノイズ除去オートエノード(SDA)を訓練する。
- 事前学習済みのSDA重みを初期値として用い、出力層で元の入力を再構築することを目的としたマルチレイヤーパーセプトロン(MLP)を微調整する。
- 訓練済みのMLPをアンラップし、入力から低次元コードへのマッピングを行うエンコーダーと、コードからスペクトルへのマッピングを行うデコーダーの2つの別々のサブネットワークに分割する。
- 得られた符号化は、可逆性、次元の低さ、ノイズ耐性、補間可能性—音声合成に不可欠な主な特性—を満たすように設計されている。
- SLTボイスを用いたClusterGen合成器を用いて、MCDと主観的品質をMCEPベースラインと比較して評価する。
- 層の数や幅の影響を調査するため、異なる層次元を有する複数のSDAアーキテクチャを訓練する。
実験結果
リサーチクエスチョン
- RQ1ディープラーニングモデルは、可逆性、ノイズ耐性、次元の低さ、補間可能性という4つの主要な要件を満たすデータ駆動型パrameterizationを学習できるか?
- RQ2MCEP表現と比較して、DNNベースのパrameterizationはスペクトル再構築(MCD)および主観的品質の観点でどの程度の性能を示すか?
- RQ3ネットワークの深さと幅は、学習されたパrameterizationの品質にどのような影響を及ぼすか?
- RQ4学習された表現は、ClusterGenのようなクラスタリングベースの合成システムに不可欠な補間性を満たしているか?
- RQ5MCDスコアは良好であるにもかかわらず、なぜDNNベースのアプローチは主観的に劣っているのか?また、目的関数の選択が果たす役割は何か?
主な発見
- 提案されたDNNベースのパrameterizationは、SLTボイスにおいてメルケプストラル歪み(MCD)3.827を達成し、MCEPベースラインと同等の性能を示した。
- 本手法は、可逆的かつノイズ耐性のある表現を効果的に生成した。SDAの事前学習により、低次元特徴の安定した学習が可能になった。
- 学習された符号化は、ClusterGen合成器がそのクラスタリングベースのアプローチで効果的に使用できることから、補間可能な空間に位置していることが裏付けられた。
- より深いネットワーク(例:200x175x125x75x50)は、浅いネットワークよりも優れた性能を示し、深さが増すにつれてMCDは4.315から3.827に低下した。これは、深さに大きな利点があることを示している。
- MCDは良好であったが、主観的品質はMCEPsをやや下回った。これは、学習中に合成最適化の目的関数が使用されていなかったためと考えられる。
- 事前学習時にガウスノイズを使用した場合、従来のゼロマスキングノイズよりも性能が劣った。これは、ノイズモデルが学習に顕著な影響を及ぼすことを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。