[論文レビュー] Automatic Prosody Prediction for Chinese Speech Synthesis using BLSTM-RNN and Embedding Features
本論文は、特徴工学を不要とする、スタックされたフィードフォワードおよび双方向LSTM(BLSTM)層を用いたニューラルネットワーク手法を提案し、文字列から中国語のプロソディック境界(PW、PPH、IPH)を直接予測する。CRFベースの手法よりも優れた性能を達成し、大規模な生テキストから学習した文字埋め込み特徴を用いることでさらなる向上が得られ、主観的評価において合成音声の自然さが著しく向上した。
Prosody affects the naturalness and intelligibility of speech. However, automatic prosody prediction from text for Chinese speech synthesis is still a great challenge and the traditional conditional random fields (CRF) based method always heavily relies on feature engineering. In this paper, we propose to use neural networks to predict prosodic boundary labels directly from Chinese characters without any feature engineering. Experimental results show that stacking feed-forward and bidirectional long short-term memory (BLSTM) recurrent network layers achieves superior performance over the CRF-based method. The embedding features learned from raw text further enhance the performance.
研究の動機と目的
- 手動による特徴工学に依存せずに、中国語の音声合成における自動的プロソディック境界予測の課題に取り組むこと。
- CRFベースのモデルが正確な語区切りや品詞タグ付けに依存する問題を克服し、誤り伝播のリスクを低減すること。
- 特にBLSTM-RNNを用いた深層ニューラルネットワークが、逐次的なプロソディック構造をモデル化する有効性を検証すること。
- 生テキストから学習した文字レベルの埋め込み特徴が、プロソディック境界予測の性能向上に寄与するかどうかを調査すること。
- 主観的聴取テストを通じて、提案手法が合成音声の自然さに与える影響を評価すること。
提案手法
- 生の中国語文字を入力とし、ワンホット表現の代わりに分散表現ベクトルにマップするニューラルネットワークアーキテクチャを採用する。
- 文字列からの階層的文脈表現を学習するために、フィードフォワードニューラルネットワーク(FFNN)と双方向LSTM(BLSTM)層をスタックする。
- 各文字にラベル(B、NB、O)を割り当てるためのシーケンスタギングとして、ビタビアルゴリズムを適用する。
- 無教師学習の事前学習目的を用いて大規模な生テキストコーパスから文字埋め込み特徴を学習し、その後メインモデルで微調整する。
- 勾配降下法にモーメンタムを適用し、検証セットの性能に基づく早期停止を用いてネットワークを訓練する。
- 予測されたプロソディックラベルをHMMベースのTTSシステムの入力として用い、合成音声の自然さを評価するためのA/B好みテストを実施する。
実験結果
リサーチクエスチョン
- RQ1手動による特徴工学を一切行わず、文字列から直接中国語のプロソディック境界を予測できる深層ニューラルネットワークアーキテクチャは存在するか?
- RQ2フィードフォワード層とBLSTM層をスタックすることで、CRFベースのモデルと比較してプロソディック境界予測性能が向上するか?
- RQ3生テキストから学習した文字埋め込み特徴は、どの程度プロソディック境界予測の正確性を向上させるか?
- RQ4ニューラルネットワークベースのプロソディック境界予測を用いることで、CRFベースの手法と比較して合成音声の自然さが向上するか?
- RQ5中国語TTSにおけるプロソディック境界予測の最適なネットワークトポロジーや埋め込みサイズは何か?
主な発見
- FBBトポロジを用いた提案されたBLSTM-RNNモデルは、プロソディックワード(PW)予測で96.35%のF1スコアを達成し、CRFベースラインの96.03%を上回った。
- プロソディックフレーズ(PPH)予測では、84.57%のF1スコアを記録し、CRFベースラインの83.06%を顕著に上回った。
- イントネーションフレーズ(IPH)予測では、FBBトポロジで81.63%のF1スコアを達成し、CRFベースラインの78.71%を上回った。
- 文字埋め込み特徴の使用によりさらなる性能向上が得られ、最適な埋め込みサイズを用いることで、PWで96.59%、PPHで84.96%、IPHで82.27%のF1スコアを達成した。
- 主観的A/Bテストでは、埋め込み特徴を用いたニューラルネットワークで合成された音声が、CRFベースの合成音声よりも65%の割合で好まれ、ワンホット表現よりも70%の割合で好まれ、自然さの向上が示された。
- 最も優れた性能を発揮したモデルアーキテクチャは、プロソディックレベルにかかわらず、常にFBB(フィードフォワード、双方向LSTM、双方向LSTM)であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。