Skip to main content
QUICK REVIEW

[論文レビュー] TalkNet 2: Non-Autoregressive Depth-Wise Separable Convolutional Model for Speech Synthesis with Explicit Pitch and Duration Prediction

Stanislav Beliaev, Boris Ginsburg|arXiv (Cornell University)|Apr 16, 2021
Speech Recognition and Synthesis参考文献 28被引用数 5
ひとこと要約

TalkNet 2 は、深さ方向に分離可能な畳み込みを用いて、グラフムの持続時間とピッチを明示的に予測する非自己回帰的で完全に畳み込み型の音声合成モデルである。これにより、高速で高精度かつ高耐性のある音声合成が可能となる。13.2MパラメータでMOSが4.08に達し、最先端のモデルと比較して約2倍小さい。バッチサイズ1で132倍リアルタイムの推論速度を実現する。

ABSTRACT

We propose TalkNet, a non-autoregressive convolutional neural model for speech synthesis with explicit pitch and duration prediction. The model consists of three feed-forward convolutional networks. The first network predicts grapheme durations. An input text is expanded by repeating each symbol according to the predicted duration. The second network predicts pitch value for every mel frame. The third network generates a mel-spectrogram from the expanded text conditioned on predicted pitch. All networks are based on 1D depth-wise separable convolutional architecture. The explicit duration prediction eliminates word skipping and repeating. The quality of the generated speech nearly matches the best auto-regressive models - TalkNet trained on the LJSpeech dataset got MOS 4.08. The model has only 13.2M parameters, almost 2x less than the present state-of-the-art text-to-speech models. The non-autoregressive architecture allows for fast training and inference. The small model size and fast inference make the TalkNet an attractive candidate for embedded speech synthesis.

研究の動機と目的

  • 自己回帰的TTSモデルにおける語の省略や繰り返しを解消するために、アテンションベースのアライメントを明示的な持続時間予測に置き換える。
  • メルスペクトログ램生成段階で自己回帰的生成を排除することで、並列な学習と推論を可能にする。
  • 高い音声品質を維持したまま、モデルサイズと計算コストを削減する。
  • 主な生成プロセスからこれらのプロソディック特徴(持続時間とピッチ)を分離することで、音声の持続時間とピッチに対する制御性を向上させる。
  • リソース制限のある組み込みデバイスへのデプロイに適した軽量で効率的なTTSシステムを開発する。

提案手法

  • 入力テキストからグラフムの持続時間を予測するために1次元の深さ方向に分離可能な畳み込みネットワークを用い、アテンションベースのアライメントを置き換える。
  • 予測された持続時間に従って各グラフムを繰り返し、持続時間拡張シーケンスを作成する。
  • 拡張シーケンスの各フレームに対してピッチ値を予測するために、2番目の深さ方向に分離可能な畳み込みネットワークを適用する。
  • 拡張テキストと予測されたピッチを条件として、メルスペクトログラムを生成するための3番目の深さ方向に分離可能な畳み込みネットワークを訓練する。
  • CTCベースのASRモデルを用いたビタビデコーディングにより、正確な教師強化学習用のアライメントを取得し、持続時間予測器の学習に活用する。
  • 生成されたメルスペクトログラムから音声を合成するために、別個の外部ボコーダー(WaveGlow や HiFi-GAN)を活用する。

実験結果

リサーチクエスチョン

  • RQ1非自己回帰的TTSモデルにおける明示的な持続時間予測は、アテンション機構に依存せずに、語の省略や繰り返しを効果的に解消できるか?
  • RQ2完全に畳み込み型の深さ方向に分離可能なアーキテクチャは、Tacotron 2 などの自己回帰的モデルと同等の音声品質を達成しつつ、モデルサイズを小さくできるか?
  • RQ3非自己回帰的TTSモデルの推論速度は、バッチサイズの増加に伴い、自己回帰的ベースラインと比較してどのようにスケーリングするか?
  • RQ4ビタビデコーディングを用いたCTCベースのアライメント抽出法は、グリーディデコーディングに比べて、より正確な持続時間の教師信号を提供できるか?
  • RQ5非自己回帰的TTSシステムにおいて、モデルの効率性(パラメータ数、推論速度)と音声品質のトレードオフはどのようなものか?

主な発見

  • HiFi-GANボコーダーを組み合わせたTalkNetは、LJSpeechデータセットでMOSが4.08を達成し、Tacotron 2(4.20)とFastPitch(4.13)とほぼ同等の品質を実現した。
  • モデルはたった13.2Mのパラメータしかおらず、最先端モデルのFastSpeech(30.1M)やTacotron-2(28.2M)と比較して約2倍少ない。
  • V100 GPU上でバッチサイズ1で推論を実行した場合、リアルタイムの132倍の速度に達し、バッチサイズ32では2531倍のリアルタイム速度に達する。これは優れたスケーラビリティを示している。
  • 明示的な持続時間予測器は81%の正確性を達成し、1フレームの絶対誤差内で95%のクラスをカバーしており、語の省略や繰り返しを顕著に低減した。
  • モデルは困難なテスト文に対しても頑健である:語の省略や繰り返しを完全に排除した。これはTacotron 2 などの自己回帰的モデルとは対照的である。
  • 8枚のV100 GPUを搭載したDGX-1サーバーで、全モデルの学習は2時間未満で完了した。持続時間予測の学習は11分、メルスペクトログラム生成は2時間未満で完了した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。