Skip to main content
QUICK REVIEW

[論文レビュー] Speaking style adaptation in Text-To-Speech synthesis using Sequence-to-sequence models with attention

Bajibabu Bollepalli, Lauri Juvela|arXiv (Cornell University)|Oct 29, 2018
Speech Recognition and Synthesis参考文献 27被引用数 4
ひとこと要約

本論文は、通常の発話で訓練された一括出力型音声合成(TTS)モデルを、限定的なロムバールデータを用いてロムバール風の発話を生成可能な形に転移学習で適応する手法を提案する。30分間のロムバール発話データを用いた微調整と、メルスペクトログ램に条件付けられたWaveNet音声生成器を採用することで、スタイルの類似性と自然さの両面でベースライン手法を著しく上回り、合成ロムバール発話品質において最先端の結果を達成した。

ABSTRACT

Currently, there are increasing interests in text-to-speech (TTS) synthesis to use sequence-to-sequence models with attention. These models are end-to-end meaning that they learn both co-articulation and duration properties directly from text and speech. Since these models are entirely data-driven, they need large amounts of data to generate synthetic speech with good quality. However, in challenging speaking styles, such as Lombard speech, it is difficult to record sufficiently large speech corpora. Therefore, in this study we propose a transfer learning method to adapt a sequence-to-sequence based TTS system of normal speaking style to Lombard style. Moreover, we experiment with a WaveNet vocoder in synthesis of Lombard speech. We conducted subjective evaluations to assess the performance of the adapted TTS systems. The subjective evaluation results indicated that an adaptation system with the WaveNet vocoder clearly outperformed the conventional deep neural network based TTS system in synthesis of Lombard speech.

研究の動機と目的

  • エンドツーエンドTTSシステムのトレーニングに適した高品質なロムバール発話データが限られているという課題に対処すること。
  • 騒音環境下での発話の聞き取りやすさを向上させるために、TTSシステムがロムバール風の発話を合成可能であることを実現すること。
  • 転移学習が、最小限のターゲットドメインデータを用いて、通常風TTSモデルをロムバール風に効果的に適応できるかを検証すること。
  • 特にWaveNetを含む異なる音声生成器が、適応されたロムバール発話の品質と自然さに与える影響を評価すること。

提案手法

  • 通常の発話で事前学習された一括出力型TTSモデル(Tacotronに基づく)を、ロムバール発話データのみ30分で微調整する。
  • 一括出力型モデルの出力から抽出したメルスペクトログラムに条件付けられたWaveNet音声生成器を用いて、生波形を生成する。
  • 転移学習を用いて、ロムバール特有の抑揚特徴(周波数の上昇や発声強度の増加など)を学習できるように、モデルのアテンションおよびデコーダーレイヤーを適応させる。
  • 話者に条件付けられたコンditionィングを適用することで、話者アイデンティティを保持しつつ発話スタイルを適応させる。
  • LSTMおよびTransformerベースのエンコーダデコーダー構造を用いて微調整を実施し、性能を比較する。
  • TTSモデルを通常発話で事前学習した後、ロムバール風に適応するマルチステージのトレーニングパイプラインを採用する。

実験結果

リサーチクエスチョン

  • RQ1通常発話で学習された一括出力型TTSモデルが、最小限のターゲットドメインデータを用いて、高品質なロムバール風発話を効果的に生成できるか?
  • RQ2音声生成器の選択(特にWaveNet対従来のWorld音声生成器)が、合成ロムバール発話における自然さとスタイルの正確性に与える影響は何か?
  • RQ3メルスペクトログラムに条件付けられたWaveNet音声生成器を適用することで、エンドツーエンドのWaveNet学習に比べ、適応されたロムバール発話の品質が向上するか?
  • RQ4適応されたシステムの性能は、既存のLSTMベースのTTSシステムと比較して、スタイルの類似性と自然さの点で優れているか?
  • RQ5モデルアーキテクチャ(LSTM対Transformer)が、低データ環境下でのスタイル適応の有効性に与える影響は何か?

主な発見

  • メルスペクトログラムに条件付けられたWaveNet音声生成器を用いたシステムS5が、最も高いスタイル類似性スコアを達成し、自然なロムバール発話の音響的特徴に最も近い結果を示した。
  • CCRテストにおける自然さ評価において、WaveNetベースのシステム(S5)はベースラインシステム(S1)を著しく上回り、平均自然さスコアで統計的に有意な改善が見られた。
  • WaveNet音声生成器を用いたシステムは、World音声生成器を用いたシステムと比較して、スタイル類似性および自然さの両評価で一貫して高いスコアを記録した。
  • 30分間のターゲットドメインデータのみで、ロムバール風発話を効果的に生成でき、低リソース環境下における転移学習の有効性を実証した。
  • WaveNet音声生成器を用いたTransformerベースのモデル(S5)が、主観聴取テストにおいてLSTMベースおよびベースラインシステムをすべて上回り、全体的な性能が最良であった。
  • 結果から、メルスペクトログラムに条件付けられたWaveNet音声生成器を適用することで、限られた学習データでも合成ロムバール発話の品質が向上することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。