[論文レビュー] Controllable neural text-to-speech synthesis using intuitive prosodic features
本論文では、文単位の音声特徴(ピッチ、ピッチレンジ、発話時間、エネルギー、スペクトル傾き)を条件として用いることで、一貫したエンド・ツー・エンドの神経音声合成システムを提案し、プロソディの直感的かつ分離可能な制御を可能にする。モデルは自然さ(MOS 4.23 vs. ベースライン 4.26)を同等に維持しながら、プロソディ的次元の直接操作により多様な話し方を実現する。
Modern neural text-to-speech (TTS) synthesis can generate speech that is indistinguishable from natural speech. However, the prosody of generated utterances often represents the average prosodic style of the database instead of having wide prosodic variation. Moreover, the generated prosody is solely defined by the input text, which does not allow for different styles for the same sentence. In this work, we train a sequence-to-sequence neural network conditioned on acoustic speech features to learn a latent prosody space with intuitive and meaningful dimensions. Experiments show that a model conditioned on sentence-wise pitch, pitch range, phone duration, energy, and spectral tilt can effectively control each prosodic dimension and generate a wide variety of speaking styles, while maintaining similar mean opinion score (4.23) to our Tacotron baseline (4.26).
研究の動機と目的
- エンド・ツー・エンドの神経音声合成システムにおいて、プロソディの明示的制御が不足しており、しばしば平均的なプロソディスタイルを生成するという問題に対処すること。
- 言語的コンテンツからプロソディを分離することで、同じテキストに対して多様な話し方を可能にすること。
- 潜在埋め込みではなく、知覚的に意味のある分離可能な音声特徴に基づくプロソディ制御メカニズムの開発。
- 非専門家が直感的にプロソディを調整できるようにすることで、音声アシスタントアプリケーションにおける使いやすさを向上させること。
- 録音条件やバックグラウンドノイズに依存しない特徴を用いることで、堅牢性を確保すること。
提案手法
- 入力テキストから予測されたプロソディック特徴(ピッチ、ピッチレンジ、音節発話時間、エネルギー、スペクトル傾き)を条件として、タコトロン風のエンコーダ・デコーダモデルを学習する。
- エンコーダ出力からこれらのプロソディック特徴を直接予測するようにモデルを学習させ、テキストからプロソディをエンド・ツー・エンドで学習可能にする。
- 各特徴を独立的かつ制御可能に予測できる共有潜在空間をプロソディモデリングに用いる。
- 各プロソディック特徴に範囲 [-1, 1] のバイアスパラメータを適用し、話し方のスタイルを直感的に制御可能にする。
- テキストとプロソディック特徴がアラインされた大規模データセット(52時間分の音声)を用いてモデルを学習する。
- 目標値と生成されたプロソディック特徴の整合性を高めるために、修正された損失関数を用いる。
実験結果
リサーチクエスチョン
- RQ1潜在埋め込みではなく、直感的で知覚的に意味のある音声特徴を用いることで、プロソディを効果的に制御できるか?
- RQ2明示的な特徴を用いたプロソディ制御は、標準的なタコトロンベースラインと比較して、音声の自然さを維持または向上させるか?
- RQ3音声専門知識のないユーザーが、プロソディの直感的なレバーを用いて、より表現的または適切な合成音声を生成できるか?
- RQ4ピッチ、発話時間、エネルギーの極端な値において、プロソディ制御の堅牢性はどの程度保たれるか?
- RQ5参照音声や手動ラベルなしに、知覚的に明確で実用的な話し方のスタイルを生成できるか?
主な発見
- 提案モデルは平均評価得点(MOS)4.23を達成し、タコトロンベースライン(4.26)とほぼ同等の自然さを示しており、音声の自然さが同等であることを裏付けている。
- 客観的分析により、目標プロソディック特徴値と合成音声で測定された値との間に強い相関が確認された。
- 聴取者による評価では、プロソディを変更した合成発話が63%の割合で好まれ、44%のケースではオリジナルのスタジオ録音よりも好まれた。
- 極端なプロソディ設定(例:ピッチバイアス = 1.0 や低エネルギー)では、持続的な高音程やささやき声のような劣化が生じ、発声の生理的限界を示唆した。
- モデルは各プロソディック次元に対して分離可能で独立した制御を可能にし、話し方のスタイルを直感的に調整できる。
- 非専門家がより表現的で文脈に適した音声を生成できるため、本システムは音声アシスタントアプリケーションにおいて実用的であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。