Skip to main content
QUICK REVIEW

[論文レビュー] Seed-TTS: A Family of High-Quality Versatile Speech Generation Models

Philip Anastassiou, Jiawei Chen|arXiv (Cornell University)|Jun 4, 2024
Speech Recognition and Synthesis被引用数 4
ひとこと要約

Seed-TTS は、人間の発話にほとんど区別がつかない高品質で、自己回帰的かつ拡散ベースの音声合成モデルのファミリを提供する。このモデルは、人間らしい表現性と制御性を備えており、ゼロショットの文脈内学習、話者類似度、自然さの面で最先端の性能を達成する。独自の自己蒸留法により音色の分離を実現し、強化学習を用いてモデルの頑健性と制御性を向上させている。

ABSTRACT

We introduce Seed-TTS, a family of large-scale autoregressive text-to-speech (TTS) models capable of generating speech that is virtually indistinguishable from human speech. Seed-TTS serves as a foundation model for speech generation and excels in speech in-context learning, achieving performance in speaker similarity and naturalness that matches ground truth human speech in both objective and subjective evaluations. With fine-tuning, we achieve even higher subjective scores across these metrics. Seed-TTS offers superior controllability over various speech attributes such as emotion and is capable of generating highly expressive and diverse speech for speakers in the wild. Furthermore, we propose a self-distillation method for speech factorization, as well as a reinforcement learning approach to enhance model robustness, speaker similarity, and controllability. We additionally present a non-autoregressive (NAR) variant of the Seed-TTS model, named $ ext{Seed-TTS}_ ext{DiT}$, which utilizes a fully diffusion-based architecture. Unlike previous NAR-based TTS systems, $ ext{Seed-TTS}_ ext{DiT}$ does not depend on pre-estimated phoneme durations and performs speech generation through end-to-end processing. We demonstrate that this variant achieves comparable performance to the language model-based variant and showcase its effectiveness in speech editing. We encourage readers to listen to demos at \url{https://bytedancespeech.github.io/seedtts_tech_report}.

研究の動機と目的

  • 多様な話者や言語において、人間並みの自然さと表現力を実現する音声生成の基盤モデルの開発。
  • 微調整を一切行わずに、短い登録音声クリップのみで任意の話者に対してゼロショットの文脈内学習を可能にする。
  • 感情、発話速度、音色などの音声属性に対するモデルの制御性を向上させる。
  • 従来の非自己回帰的TTSモデルの限界を是正し、事前に推定された発音時間に依存しないようにする。
  • 複数段階の検証とウォーターマーキングなどの安全対策を導入することで、責任あるAIの展開を確保する。

提案手法

  • 音声トークナイザー、自己回帰的トークン言語モデル、拡散ベースのトークン精錬モデル、高精細音声合成のための音声生成器という4段階のパイプラインを採用。
  • モデル構造や損失関数を変更せずに、音色要因の分離を実現する自己蒸留技術を採用し、優れた音声変換性能を達成。
  • 微調整後に強化学習を適用し、人間の好みを最適化することで、話者類似度、頑健性、制御性を向上。
  • 完全に拡散ベースのアーキテクチャに基づく非自己回帰型バージョン、$ ext{Seed-TTS}_{ ext{DiT}}$ を導入。発音時間の予測を必要とせず、エンドツーエンドで音声の潜在表現を生成可能。
  • 従来のシステムと比べて桁違いに多数のデータを用いた大規模事前学習を実施し、顕在的な一般化能力と文脈内学習能力を実現。
  • 不正利用を防止し、倫理的な展開を確保するため、複数レベルのウォーターマーキングと複数段階の話者検証を実装。

実験結果

リサーチクエスチョン

  • RQ1大規模な自己回帰的TTSモデルは、微調整を一切行わず、ゼロショットの文脈内学習において人間並みの自然さと話者類似度を達成できるか?
  • RQ2モデル構造や損失関数を変更せずに、自己蒸留法が音色要因の分離にどの程度効果的か?
  • RQ3微調整後の強化学習は、音声生成における話者類似度、頑健性、制御性をどの程度向上できるか?
  • RQ4完全に拡散ベースの非自己回帰的TTSモデルは、発音時間の推定を必要とせず、エンドツーエンドで生成可能でありながら、自己回帰モデルと同等の性能を発揮できるか?
  • RQ5音声編集タスク、例えば内容の回復や発話速度調整において、モデルの性能はどの程度高いか?

主な発見

  • Seed-TTS はゼロショットの文脈内学習において最先端の性能を達成し、英語ではSIMスコア0.790、中国語では0.809を記録。自己回帰型バージョンおよび音声生成器再構築ベースラインを上回った。
  • 自己蒸留法により、モデル構造や損失関数を変更せずに、音声変換タスクで最先端の性能を達成。音色の分離が効果的に実現された。
  • 微調整後の強化学習により、話者類似度と頑健性が顕著に向上し、全体的な制御性と出力品質が向上した。
  • $ ext{Seed-TTS}_{ ext{DiT}}$ は、自己回帰型バージョンと同等のWER(英語1.733、中国語1.178)と、優れたSIM(0.790および0.809)を達成。拡散ベースのフレームワーク内での強力な系列モデリングを示した。
  • コンテンツ編集のタスクでは、$ ext{Seed-TTS}_{ ext{DiT}}$ はマスクされた音声を高い話者類似度と低WRで回復でき、さまざまなマスク率において強い頑健性を示した。
  • 発話速度の編集では、$ ext{Seed-TTS}_{ ext{DiT}}$ は自然な発音の調整と、自然さを保つための沈黙挿入を実現。均一なスピードアップ/スローダウン手法を上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。