[논문 리뷰] Natural language guidance of high-fidelity text-to-speech with synthetic annotations
이 논문은 45,000시간 분량의 데이터셋에서 자기학습 레이블링을 통해 음성 속성(예: 억양, 톤, 발화 속도, 녹음 조건 등)을 자동으로 추출하고 자연어 조건부로 고해상도 음성 합성 기반의 확장 가능하고 완전 자동화된 방법을 제안한다. 이 방법은 단일 모델과 프롬프트 기반 제로샷 제어를 통해 오직 1%의 고해상도 데이터와 현대적인 오디오 코덱을 사용함으로써 최신 기술 수준의 음성 품질과 자연스러움을 달성하며, 기존의 Audiobox와 같은 기존 기술들을 능가한다.
Text-to-speech models trained on large-scale datasets have demonstrated impressive in-context learning capabilities and naturalness. However, control of speaker identity and style in these models typically requires conditioning on reference speech recordings, limiting creative applications. Alternatively, natural language prompting of speaker identity and style has demonstrated promising results and provides an intuitive method of control. However, reliance on human-labeled descriptions prevents scaling to large datasets. Our work bridges the gap between these two approaches. We propose a scalable method for labeling various aspects of speaker identity, style, and recording conditions. We then apply this method to a 45k hour dataset, which we use to train a speech language model. Furthermore, we propose simple methods for increasing audio fidelity, significantly outperforming recent work despite relying entirely on found data. Our results demonstrate high-fidelity speech generation in a diverse range of accents, prosodic styles, channel conditions, and acoustic conditions, all accomplished with a single model and intuitive natural language conditioning. Audio samples can be heard at https://text-description-to-speech.com/.
연구 동기 및 목표
- 자연어 제어 기반 TTS의 스케일링 문제를 해결하기 위해 인간 애너테이션에 의존하는 음성 기술 설명의 한계를 극복하는 것.
- 오직 자연어 프롬프트만을 사용하여 다양한 억양, 억양, 녹음 조건을 포함한 고해상도이고 다양한 음성 생성을 가능하게 하는 것.
- 화자 정체성, 스타일, 채널 조건의 새로운 조합에 일반화할 수 있는 통합된 음성 언어 모델을 훈련시키는 것.
- 최신 오디오 코덱을 활용하여 최소한의 고해상도 데이터로도 높은 오디오 품질을 달성하는 것.
- 자동 애너테이션 기반 모델이 인간 애너테이션 기반 베이스라인과 비교해 TTS 제어성과 품질 면에서 동등하거나 슈퍼어리어할 수 있음을 입증하는 것.
제안 방법
- 45,000시간 분량의 데이터셋에서 계산 기반 지표와 자기학습 모델링을 조합하여 음성 속성(성별, 억양, 톤, 발화 속도, 채널 조건 등)을 자동으로 추출하고 레이블링하는 것.
- 자동 애너테이션된 데이터로 미세조정된 대규모 음성 언어 모델을 사용하여 자연어 기술 설명에 기반한 음성 생성을 수행하는 것.
- DAC 오디오 코덱을 적용하여, 훈련 데이터에 고해상도 샘플이 1%에 불과하더라도 음성의 해상도를 향상시키는 것.
- 소규모 고품질 데이터 세트(LibriTTS-R, 약 500시간)를 활용하여 대부분의 데이터가 저해상도임에도 불구하고 고해상도 출력을 유도하는 것.
- 다양한 음성 샘플을 생성하기 위해 다수의 속성을 독립적으로 제어할 수 있는 자연어 기술 설명을 프롬프트로 제공하는 것.
- 정확한 주관적 평가를 위해 음량 정규화와 침묵 제거를 수행하여 참조값 및 기존 베이스라인과의 일관된 비교를 보장하는 것.

실험 결과
연구 질문
- RQ1완전 자동화된 합성 애너테이션 기반 음성 속성 추출이 자연어 제어 기반의 확장 가능한 고해상도 TTS를 가능하게 할 수 있는가?
- RQ2오직 자연어 프롬프트만을 사용할 때, 단일 모델이 화자 정체성, 억양, 녹음 조건의 새로운 조합에 얼마나 잘 일반화되는가?
- RQ3합성 애너테이션과 고급 오디오 코덱을 조합하여 최소한의 고해상도 데이터로도 고해상도 오디오 품질을 달성할 수 있는가?
- RQ4자동으로 애너테이션된 데이터로 훈련된 모델의 성능이 인간 애너테이션 데이터로 훈련된 모델과 비교해 자연스러움과 기술 설명 일치도 측면에서 어떻게 되는가?
- RQ5현대적인 오디오 코덱(DAC)을 사용할 경우, 합성 애너테이션과 제한된 고해상도 데이터를 조합했을 때 음성 품질이 크게 향상되는가?
주요 결과
- 주관적 자연스러움 평가에서 모델은 MOS 3.92점을 기록하여 Audiobox(2.79)를 크게 앞서며, 참조값(3.67)을 초월하는 성능을 보였다.
- 기술 설명 일치도 측면에서 모델은 3.88점을 기록하여 Audiobox(3.19)와 참조값(3.62)을 모두 앞서며 프롬프트 지시사항에 더 잘 따르는 것으로 나타났다.
- 모델은 PESQ 점수 3.84점을 기록하여 참조값(4.15)과 유사하고, STOI 0.996을 기록하여 높은 음성 이해도와 품질을 나타냈다.
- 전체 데이터 중 약 500시간의 고해상도 데이터(1%)만을 훈련 데이터로 사용했음에도 불구하고, 더 많은 데이터와 인간 애너테이션을 사용한 Audiobox를 뛰어넘는 청각적 품질을 구현했다.
- 객관적 지표 분석 결과, 모델이 합성한 레이블(예: 톤, 발화 속도)이 기술 레이블과 강하게 상관관계를 보였으며, 95% 신뢰구간을 통해 높은 신뢰도를 확보했다.
- 비표준 억양이나 노이즈가 있는 녹음 조건과 같은 새로운 조합의 속성에도 단일 자연어 프롬프트로만 제어 가능하게 일반화된 성능을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.