[논문 리뷰] Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers
본 논문은 언어 모델 기반의 TTS 시스템인 VALL-E를 제시한다. 이 시스템은 이산 오디오 코덱 코드와 등록된 녹음에서 얻은 프롬프트를 사용하여, 60k hours의 데이터로 훈련된 제로샷 TTS를 강한 자연스러움과 화자 유사도로 수행한다.
We introduce a language modeling approach for text to speech synthesis (TTS). Specifically, we train a neural codec language model (called Vall-E) using discrete codes derived from an off-the-shelf neural audio codec model, and regard TTS as a conditional language modeling task rather than continuous signal regression as in previous work. During the pre-training stage, we scale up the TTS training data to 60K hours of English speech which is hundreds of times larger than existing systems. Vall-E emerges in-context learning capabilities and can be used to synthesize high-quality personalized speech with only a 3-second enrolled recording of an unseen speaker as an acoustic prompt. Experiment results show that Vall-E significantly outperforms the state-of-the-art zero-shot TTS system in terms of speech naturalness and speaker similarity. In addition, we find Vall-E could preserve the speaker's emotion and acoustic environment of the acoustic prompt in synthesis. See https://aka.ms/valle for demos of our work.
연구 동기 및 목표
- TTS 학습 데이터를 수십만 시간 규모로 확장하여 제로샷 일반화를 개선한다.
- TTS를 이산 오디오 코덱 코드들을 중간 표현으로 사용하는 조건부 언어 모델링으로 다룬다.
- 3초 등록 녹음에서 보지 못한 화자를 합성하기 위해 프롬프트 기반의 인-컨텍스트 학습을 가능하게 한다.
- 합성 중 화자의 감정과 음향 환경을 보존한다.
- LibriSpeech와 VCTK에서 최첨단 비교대상 대비 우수한 제로샷 성능을 시연한다.
제안 방법
- 상용 신경 오디오 코덱(EnCodec)에서 얻은 이산 코드로 음성을 표현한다.
- 등록 녹음에서의 음향 프롬프트와 음소 프롬프트를 주어 음향 코드 매트릭스를 생성하기 위한 조건부 코덱 언어 모델링으로 TTS를 구성한다.
- 품질과 속도의 균형을 맞추기 위해 첫 번째 양자화기에 자기회귀 디코더를 두고 이후 양자화기에 비자기회귀 모델을 사용하는 계층적 모델을 활용한다.
- 대략 7k 화자를 가진 LibriLight 데이터의 60k 시간으로 학습하고, 감독 신호로 ASR 생성 대본을 사용한다.
- 음소 프롬프트와 음향 프롬프트를 사용한 프롬프트 기반 추론으로 보지 못한 화자의 제로샷 합성을 가능하게 한다.
- WER 및 화자 유사성 지표와 함께 인간 CMOS/SMOS 평가를 통해 평가한다.

실험 결과
연구 질문
- RQ1이산 음향 코드에 대한 조건부 언어 모델링으로 합성을 구성하면 제로샷 TTS를 달성할 수 있는가?
- RQ2반지도 학습 음성 데이터를 확대하는 것이 제로샷 TTS 성능과 보지 못한 화자에 대한 일반화를 향상시키는가?
- RQ3프롬프트 기반의 인-컨텍스트 학습이 파인튜닝 없이도 자연스럽고 화자 충실한 음성을 가능하게 하는가?
- RQ4AR(autoregressive) 및 NAR(non-autoregressive) 구성요소가 합성 품질과 추론 속도에 어떻게 기여하는가?
- RQ5표준 TTS 및 교차 데이터셋 평가(LibriSpeech, VCTK)에서 VALL-E의 견고성은 어떠한가?
주요 결과
- VALL-E는 LibriSpeech와 VCTK에서 음성 자연스러움과 화자 유사성 측면에서 제로샷 TTS의 최첨단 기준을 크게 능가한다.
- LibriSpeech에서 VALL-E는 기준 대비 CMOS +0.12, SMOS +0.93의 개선을 달성하고; VCTK에서는 ground truth 대비 CMOS +0.23, SMOS +0.04를 달성한다.
- VALL-E-continual(계속 재생 시 3s 프롬프트를 사용)에서 WER를 3.8로 감소시키고 강한 화자 유사성(SMOS 0.508)을 유지한다.
- 인간 평가에서 SMOS에서 VALL-E는 ground truth에 근접하며(0. 차이는 여유 범위 내), 기준 대비 CMOS 개선은 LibriSpeech에서 +0.12; VCTK에서 +0.23이다.
- 제거/변인 분석은 음소 프롬프트가 WER를 감소시키고 음향 프롬프트가 화자 유사성을 높이는 데 중요한 역할을 한다.
- 다른 음성-대-음성 LM 시스템(GSLM, AudioLM)과 비교할 때, VALL-E는 제로샷 TTS에서 더 높은 견고성과 화자 충실성을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.