Skip to main content
QUICK REVIEW

[論文レビュー] UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding

Chenpeng Du, Yiwei Guo|arXiv (Cornell University)|Jun 13, 2023
Speech Recognition and Synthesis参考文献 34被引用数 4
ひとこと要約

UniCATSは、文脈的VQ拡散を用いた意味的トークン生成と文脈的音声合成を統合した、統一的で文脈に配慮した音声合成フレームワークを提案する。これにより、ゼロショットのスピーカー適応型音声継続と文脈に配慮した音声編集の両方で最先端の性能を達成する。自己回帰的モデルの制限とコーデック品質の限界を克服し、左および右の文脈を同時にモデル化することで、先行手法に比べて再合成品質を向上させる。

ABSTRACT

The utilization of discrete speech tokens, divided into semantic tokens and acoustic tokens, has been proven superior to traditional acoustic feature mel-spectrograms in terms of naturalness and robustness for text-to-speech (TTS) synthesis. Recent popular models, such as VALL-E and SPEAR-TTS, allow zero-shot speaker adaptation through auto-regressive (AR) continuation of acoustic tokens extracted from a short speech prompt. However, these AR models are restricted to generate speech only in a left-to-right direction, making them unsuitable for speech editing where both preceding and following contexts are provided. Furthermore, these models rely on acoustic tokens, which have audio quality limitations imposed by the performance of audio codec models. In this study, we propose a unified context-aware TTS framework called UniCATS, which is capable of both speech continuation and editing. UniCATS comprises two components, an acoustic model CTX-txt2vec and a vocoder CTX-vec2wav. CTX-txt2vec employs contextual VQ-diffusion to predict semantic tokens from the input text, enabling it to incorporate the semantic context and maintain seamless concatenation with the surrounding context. Following that, CTX-vec2wav utilizes contextual vocoding to convert these semantic tokens into waveforms, taking into consideration the acoustic context. Our experimental results demonstrate that CTX-vec2wav outperforms HifiGAN and AudioLM in terms of speech resynthesis from semantic tokens. Moreover, we show that UniCATS achieves state-of-the-art performance in both speech continuation and editing.

研究の動機と目的

  • 自己回帰的モデルにおける音声編集の限界、特に前後の文脈が利用可能な状況を解決すること。
  • 既存の離散的トークンTTSシステムで制限を受ける音声コーデック性能に起因する音声品質の制約を克服すること。
  • 継続および編集の両タスクにおいて、自然さとスピーカーの個性を保持する、シームレスで文脈に配慮した合成を可能にすること。
  • 共通のコンponentsを有する1つのフレームワークで、音声継続と編集のパイプラインを統合すること。

提案手法

  • UniCATSは二段階のフレームワークを採用する:CTX-txt2vecは文脈的VQ拡散に基づく意味的トークン予測をテキストから行い、CTX-vec2wavはトークンから波形に変換する文脈的音声合成を行う。
  • CTX-txt2vecは、フォネティクスおよびプロソディックな文脈を条件としてVQ拡散を制御するため、コンフォーマーに基づくテキストエンコーダーと継続時間予測器を用いる。これにより、双方向の文脈統合が可能になる。
  • CTX-txt2vecにおけるVQ拡散モデルは、継続時間予測とVQ拡散再構成の両方の損失を重み付けして組み合わせた損失関数で訓練され、高精度な意味的トークン生成を可能にする。
  • CTX-vec2wavは、意味的トークンと周囲の文脈を条件として波形生成を実行し、スピーカーの個性と音声の連続性をモデル化する。
  • 学習段階では、データがランダムに文脈A、ターゲットセグメントx₀、文脈Bに分割され、x₀が拡散プロセスにより汚染され、ノイズ除去の学習が可能になる。
  • 音声編集の推論では、x_Tからx₀への反復的バックワードノイズ除去が実行され、文脈AとBに従ってガイドされ、継続時間のスケーリングにより文脈の速度に一致させる。

実験結果

リサーチクエスチョン

  • RQ1統一されたTTSフレームワークは、離散的意味的トークンを用いて、音声継続と編集の両タスクを効果的に処理できるか?
  • RQ2標準の自己回帰的モデルと比較して、文脈的VQ拡散は生成品質と文脈統合の質をどのように向上させるか?
  • RQ3標準の音声合成器と比較して、文脈的音声合成は波形品質とスピーカー個性の保持の面でどの程度向上するか?
  • RQ4このフレームワークは、ゼロショットのスピーカー適応と文脈に配慮した編集の両方で最先端の性能を達成できるか?

主な発見

  • CTX-vec2wavは、HifiGANやAudioLMよりも意味的トークンからの音声再合成において優れた波形品質を示し、優れた品質を実現している。
  • UniCATSは、VALL-E や SPEAR-TTS などのモデルに比べ、ゼロショットのスピーカー適応型音声継続で最先端の性能を達成している。
  • このフレームワークは、自然なつなぎ目とスピーカーの一貫性を保ちながら、文脈に配慮した音声編集を成功裏に実現している。
  • 文脈的VQ拡散の使用により、自己回帰的モデルの左から右への生成制限を克服し、双方向の文脈モデリングが可能になった。
  • 両方の文脈、文脈Aのみ、または文脈なしの3つのデータ設定を用いた学習スキームにより、汎化性能と頑健性が向上した。
  • 推論アルゴリズムは、前後の文脈に条件付けられた上で、スケーリング係数αによる継続時間の整合性を確保して、編集された音声を効果的に生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。