[논문 리뷰] fairseq S^2: A Scalable and Integrable Speech Synthesis Toolkit
이 논문은 fairseq 프레임워크의 확장으로 구축된 확장성 있고 통합 가능한 음성 합성 툴킷인 fairseq S²를 소개한다. 이 툴킷은 다중 화자 합성, 저자원 데이터를 위한 사전처리 도구, 자동 평가 지표를 지원하며, 엔드 투 엔드로 자동회귀 및 비자기회귀 텍스트-음성 모델을 훈련시킬 수 있도록 한다. 음성 활동 검출(VAD), 노이즈 필터링, 사전 학습된 화자 임베딩을 통한 최소한의 정제된 데이터로도 모델 성능 향상과 일반화 능력 향상을 입증한다.
This paper presents fairseq S^2, a fairseq extension for speech synthesis. We implement a number of autoregressive (AR) and non-AR text-to-speech models, and their multi-speaker variants. To enable training speech synthesis models with less curated data, a number of preprocessing tools are built and their importance is shown empirically. To facilitate faster iteration of development and analysis, a suite of automatic metrics is included. Apart from the features added specifically for this extension, fairseq S^2 also benefits from the scalability offered by fairseq and can be easily integrated with other state-of-the-art systems provided in this framework. The code, documentation, and pre-trained models are available at https://github.com/pytorch/fairseq/tree/master/examples/speech_synthesis.
연구 동기 및 목표
- 다양한 모델 아키텍처와 데이터 유형을 지원하는 통합되고 확장 가능한 음성 합성 툴킷의 부족을 해결하기 위해.
- 강력한 사전처리 파이프라인을 통해 정제되지 않은, 실생활의 음성 데이터에서 고품질 TTS 모델을 훈련시킬 수 있도록 하기 위해.
- 자동 평가 지표와 사전 학습된 구성 요소를 통합함으로써 개발 및 평가 속도를 향상시키기 위해.
- 자기학습된 음성 표현과 유닛-음성 시스템을 포함한 다른 최신 모델들과의 통합을 지원하기 위해.
- 사전 학습된 화자 임베딩을 활용해 미리 보지 않은 화자에 대해 제로샷 화자 합성을 가능하게 하여 일반화 능력을 확장하기 위해.
제안 방법
- Tacotron2, Transformer, FastSpeech2를 포함한 텍스트-스펙트로그램 모델의 세트를 fairseq에 확장하여 자동회귀 및 비자기회귀 추론을 모두 지원한다.
- 확인 모델에서 유래한 사전 학습된 화자 임베딩과 학습 가능한 화자 임베딩 룩업 테이블을 통해 다중 화자 기능을 도입한다.
- 음성 활동 검출(VAD), 노이즈 감소(DN), 신호 대 잡음비(SNR) 및 문자 오류률(CER) 기반 필터링을 포함한 오디오 사전처리 파이프라인을 구현한다.
- 모델 반복 개선을 가속화하기 위해 MCD, CER, MOS, F0/RMS 상관관계와 같은 자동 평가 지표를 통합한다.
- 자기학습된 모델에서 유도된 텍스트 또는 학습된 유닛을 입력으로 사용하여 텍스트 없는 TTS 시스템을 가능하게 한다.
- 공유된 코드베이스와 모듈러 설계를 통해 기존 fairseq 모델(ASR, MT, LM, 자기학습 학습)과 원활하게 통합할 수 있도록 한다.
실험 결과
연구 질문
- RQ1VAD, 노이즈 감소, 필터링과 같은 사전처리 파이프라인이 저자원, 실생활 음성 데이터에서 훈련 안정성과 성능 향상에 기여하는가?
- RQ2사전 학습된 화자 임베딩을 학습 가능한 임베딩과 비교했을 때 제로샷 화자 합성 및 모델 성능 측면에서 어떤가?
- RQ3MCD 및 CER와 같은 자동 평가 지표가 모델 개발 속도를 얼마나 빠르게 하고 주관적 인간 평가 의존도를 얼마나 줄일 수 있는가?
- RQ4fairseq S²가 자기학습된 음성 표현을 입력으로 사용하는 엔드 투 엔드 유닛-음성 합성 시스템을 효과적으로 지원할 수 있는가?
- RQ5자동회귀 모델에서 감소 요소가 노이즈가 있거나 완벽하지 않은 데이터에서 훈련 수렴과 합성 품질에 어떤 영향을 미치는가?
주요 결과
- 공격성 수준 3로 설정된 VAD는 평균적으로 침묵을 40% 감소시켰지만, 음성의 잘림 위험이 있었다. 최적 설정은 침묵 제거와 음성 유지 사이의 균형을 맞추었다.
- DN+VAD-3+FLT 사전처리를 적용한 결과 CER는 10% 이하로 감소했고, VCTK 및 Common Voice 데이터셋에서 MOS는 0.2~0.3 포인트 향상되었다.
- Transformer TTS 모델에서 감소 요소를 4로 설정했을 때 성능이 2보다 뛰어났으며, 사전처리 없이 원시 오디오에서 감소 요소 2로 설정했을 경우 훈련이 완전히 실패했다.
- 사전 학습된 화자 임베딩은 학습 가능한 임베딩과 유사한 성능을 달성했고, 동시에 알려지지 않은 화자에 대해 제로샷 합성을 가능하게 하였다.
- SNR 및 CER 기반으로 데이터를 필터링함으로써 MCD는 0.1 감소하고 CER는 1.5 감소하여 어려운 예제에서 모델 피팅 능력과 이해 가능성 향상이 확인되었다.
- fairseq S²와 자기학습 모델의 통합을 통해 성공적인 유닛-음성 합성 시스템을 도출하였으며, 텍스트 없는 TTS 파이프라인의 가능성은 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.