[논문 리뷰] SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
SpeechX는 다중 작업 학습과 작업별 프롬프팅을 통해 통합된 신경 코덱 언어 모델로, 단일 통합 아키텍처를 사용하여 클린 및 노이즈 있는 조건에서 제로샷 TTS, 노이즈 제거, 대상 발화자 추출, 음성 제거, 음성 편집 등 다양한 음성 생성 및 변환 작업을 수행하며, 최신 기술 수준 또는 경쟁력 있는 성능을 달성한다.
Recent advancements in generative speech models based on audio-text prompts have enabled remarkable innovations like high-quality zero-shot text-to-speech. However, existing models still face limitations in handling diverse audio-text speech generation tasks involving transforming input speech and processing audio captured in adverse acoustic conditions. This paper introduces SpeechX, a versatile speech generation model capable of zero-shot TTS and various speech transformation tasks, dealing with both clean and noisy signals. SpeechX combines neural codec language modeling with multi-task learning using task-dependent prompting, enabling unified and extensible modeling and providing a consistent way for leveraging textual input in speech enhancement and transformation tasks. Experimental results show SpeechX's efficacy in various tasks, including zero-shot TTS, noise suppression, target speaker extraction, speech removal, and speech editing with or without background noise, achieving comparable or superior performance to specialized models across tasks. See https://aka.ms/speechx for demo samples.
연구 동기 및 목표
- 다양한 음성-텍스트 음성 작업, 특히 노이즈 있는 다중 발화자 음성의 변환을 처리할 수 있는 통합 생성 모델의 부족을 해결한다.
- 이전 모델이 노이즈 있는 신호에서 음성 편집을 수행할 수 없거나 전용 아키텍처 없이 대상 발화자 추출을 처리할 수 없는 한계를 극복한다.
- 텍스트와 음성 프롬프트에 일관된 조건부 처리를 제공하는 단일 확장 가능한 모델 아키텍처를 통해 강력한 제로샷 음성 생성 및 변환을 가능하게 한다.
- TTS, 노이즈 제거, 발화자 추출, 제거, 편집 등의 다양한 음성 작업을 작업별 토큰을 사용한 단일 신경 코덱 언어 모델링 프레임워크로 통합한다.
- 다양한 음성 조건에서 훈련하여 음성 왜곡에 대한 모델의 강건성을 향상시키며, 동시에 모든 작업에서 고품질 출력을 유지한다.
제안 방법
- 텍스트와 음성 프롬프트에 조건부로 이산 음성 토큰을 생성하는 신경 코덱 언어 모델을 사용하여 종단 간 음성 생성 및 변환을 가능하게 한다.
- 다양한 작업을 단일 모델 아키텍처 내에서 통합하기 위해 작업별 조건부 토큰(예: 'TTS', 'denoise', 'extract')을 도입한다.
- 음성 향상 및 변환을 위한 가이드 역할을 하는 선택적이지만 정보적인 프롬프트로 텍스트 입력을 사용하여 분리성과 이해 가능성 향상.
- 공통된 음성 및 텍스트 인코더를 사용하여 제로샷 TTS, 음성 편집, 노이즈 제거, 음성 제거, 대상 발화자 추출 등 다양한 작업의 혼합 데이터로 모델을 종단 간 훈련한다.
- 음성 토큰화에 EnCodec 모델을 활용하지만, 특히 PESQ 점수에서 코덱 유도 오차로 인해 성능이 제한됨.
- 입력 오디오, 텍스트(가능한 경우), 그리고 작업별 토큰에 조건부로 음성 토큰을 생성하는 통합 추론 메커니즘을 적용한다.
실험 결과
연구 질문
- RQ1단일 통합 생성 모델이 노이즈 있는 환경에서 제로샷 TTS와 음성 변환을 포함한 다양한 음성-텍스트 기반 음성 작업을 효과적으로 처리할 수 있는가?
- RQ2텍스트 입력을 프롬프트로 통합할 경우, 노이즈 제거 및 대상 발화자 추출과 같은 음성 향상 및 변환 작업 성능에 어떤 영향을 미치는가?
- RQ3다중 작업 학습이 다양한 음성 생성 및 변환 작업 간의 강건성과 일반화 능력을 얼마나 향상시키는가?
- RQ4신경 코덱을 사용할 경우, PESQ 및 DNSMOS와 같은 품질 지표에서 하류 음성 생성 및 변환 작업의 성능에 어떤 영향을 미치는가?
- RQ5이전 모델이 청소된 입력에 한정되어 있는 반면, 통합 모델이 노이즈 있는 신호에서 경쟁적인 음성 편집 성능을 달성할 수 있는가?
주요 결과
- SpeechX는 제로샷 TTS, 노이즈 제거, 대상 발화자 추출, 음성 제거, 음성 편집 등 평가된 모든 작업에서 전문 모델과 비교해도 경쟁력 있거나 뛰어난 성능을 달성한다.
- 텍스트 입력의 포함으로 대상 발화자 추출에서 DNSMOS 및 WER 점수가 유의미하게 향상되어 간섭하는 다른 발화자로부터의 음성 분리가 향상됨을 시사한다.
- 음성 편집 작업을 훈련에 포함시킴으로써 제로샷 TTS 성능이 향상되어 작업 다양성에 기인한 유용한 데이터 분포 이동이 있음을 시사한다.
- 노이즈 제거 및 음성 제거 작업을 훈련에 포함시킴으로써 음성 편집에서 노이즈에 대한 강건성이 향상되지만, 청소된 음성 편집 품질에는 약간의 성능 손실가능성 존재.
- EnCodec를 음성 토큰화에 사용함으로써 청소된 음성에서 PESQ 점수가 4.64에서 2.69로著격히 떨어지는 현상이 발생하여 평가 지표와의 코덱 불일치로 인한 성능 저하 요인이 드러남.
- 대상 발화자 추출을 훈련에 포함시켜도 음성 제거 및 노이즈 제거 작업에서 성능 저하 없이 우수한 성능 유지함을 보여줌.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.