[논문 리뷰] Seed-TTS: A Family of High-Quality Versatile Speech Generation Models
Seed-TTS는 인간과 구분되지 않을 정도로 고품질이며, 표현력 있고 제어 가능한 음성 생성이 가능한 자동회귀형 및 확산 기반 텍스트-to-음성 모델의 일족을 소개한다. 이는 피어슨 상관계수 기반의 제로샷 인-컨텍스트 학습, 화자 유사도, 자연스러움에서 최고 성능을 기록하며, 음색 분리에 대한 새로운 자기정복 기법과 모델의 강건성 및 제어 가능성을 향상시키기 위한 강화학습 기반 접근법을 도입한다.
We introduce Seed-TTS, a family of large-scale autoregressive text-to-speech (TTS) models capable of generating speech that is virtually indistinguishable from human speech. Seed-TTS serves as a foundation model for speech generation and excels in speech in-context learning, achieving performance in speaker similarity and naturalness that matches ground truth human speech in both objective and subjective evaluations. With fine-tuning, we achieve even higher subjective scores across these metrics. Seed-TTS offers superior controllability over various speech attributes such as emotion and is capable of generating highly expressive and diverse speech for speakers in the wild. Furthermore, we propose a self-distillation method for speech factorization, as well as a reinforcement learning approach to enhance model robustness, speaker similarity, and controllability. We additionally present a non-autoregressive (NAR) variant of the Seed-TTS model, named $ ext{Seed-TTS}_ ext{DiT}$, which utilizes a fully diffusion-based architecture. Unlike previous NAR-based TTS systems, $ ext{Seed-TTS}_ ext{DiT}$ does not depend on pre-estimated phoneme durations and performs speech generation through end-to-end processing. We demonstrate that this variant achieves comparable performance to the language model-based variant and showcase its effectiveness in speech editing. We encourage readers to listen to demos at \url{https://bytedancespeech.github.io/seedtts_tech_report}.
연구 동기 및 목표
- 다양한 화자와 언어에서 인간 수준의 자연스러움과 표현력을 구현하는 음성 생성을 위한 기초 모델 개발.
- 사용자 정의된 화자에 대해 단일 짧은 등록 클립만으로도 미세조정 없이 제로샷 인-컨텍스트 학습을 가능하게 하는 것.
- 감정, 발화 속도, 음색과 같은 음성 속성에 대한 모델 제어 능력 향상.
- 기존 비자동회귀형 TTS 모델의 한계를 보완하기 위해 사전에 추정된 음소 지속 시간에 의존하지 않는 것.
- 다단계 검증 및 워터마킹과 같은 안전 메커니즘을 통해 책임감 있는 AI 배포 보장.
제안 방법
- 사운드 토크나이저, 자동회귀형 토큰 언어 모델, 확산 기반 토큰 정제 모델, 고해상도 음성 합성용 음성 복원기로 구성된 사단계 파이프라인을 사용.
- 모델 아키텍처나 손실 함수를 수정하지 않고도 음색 요소를 분리하는 자기정복 기법을 적용하여, 뛰어난 음성 변환 성능 달성.
- 사용자 선호도를 최적화하기 위해 사후 훈련 단계에서 강화학습을 적용하여 화자 유사도, 강건성, 제어 가능성을 향상.
- 완전히 확산 기반 아키텍처를 기반으로 한 비자동회귀형 변종인 $\text{Seed-TTS}_{\text{DiT}}$를 도입하여 지속 시간 예측이 필요 없이 음성 잠재 표현을 종합적으로 생성.
- 이전 시스템보다 수개의 순서만큼 더 많은 데이터로 대규모 사전 훈련을 수행하여 잠재적인 일반화 능력과 인-컨텍스트 학습 능력 유도.
- 사용자 오용 방지를 위한 다단계 워터마킹 및 다단계 화자 검증을 구현하여 윤리적 배포 보장.
실험 결과
연구 질문
- RQ1대규모 자동회귀형 TTS 모델이 미세조정 없이 제로샷 인-컨텍스트 학습에서 인간 수준의 자연스러움과 화자 유사도를 달성할 수 있는가?
- RQ2모델 아키텍처나 손실 함수를 수정하지 않고도 자기정복 기법이 음색 요소 분리에 얼마나 효과적인가?
- RQ3강화학습이 음성 생성에서 화자 유사도, 강건성, 제어 가능성을 얼마나 향상시킬 수 있는가?
- RQ4완전히 확산 기반의 비자동회귀형 TTS 모델이 지속 시간 추정 없이 자동회귀형 모델과 동등한 성능을 달성할 수 있는가?
- RQ5콘텐츠 복구 및 발화 속도 조절과 같은 음성 편집 작업에서 모델의 성능은 어떠한가?
주요 결과
- Seed-TTS는 제로샷 인-컨텍스트 학습에서 최고 성능을 기록하며, 영어의 경우 SIM 점수 0.790, 중국어의 경우 0.809를 기록하여 자동회귀형 변종 및 복원기 기반 기준 모델를 모두 압도한다.
- 자기정복 기법을 통해 모델 아키텍처나 손실 함수를 변경하지 않아도 음색 분리가 효과적으로 이루어지며, 음성 변환 작업에서 최고 성능 달성.
- 사후 훈련 단계에서 강화학습을 적용함으로써 화자 유사도와 강건성이 크게 향상되어 전체적인 제어 가능성과 출력 품질 향상.
- $\text{Seed-TTS}_{\text{DiT}}$는 자동회귀형 변종과 유사한 WER(영어 1.733, 중국어 1.178)와 뛰어난 SIM 점수(영어 0.790, 중국어 0.809)를 기록하여 확산 기반 아키텍처 내에서도 강력한 시퀀스 모델링 능력 입증.
- 콘텐츠 편집 작업에서 $\text{Seed-TTS}_{\text{DiT}}$는 마스크된 오디오를 높은 화자 유사도와 낮은 WER로 복구하며, 다양한 마스크 비율에서도 뛰어난 강건성 확보.
- 발화 속도 편집 작업에서 $\text{Seed-TTS}_{\text{DiT}}$는 자연스럽게 발음 조정과 정적 삽입을 통해 자연스러움을 유지하며, 균일한 속도 조절 방법보다 뛰어난 성능 보여.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.