[논문 리뷰] Hierarchical Sequence to Sequence Voice Conversion with Limited Data
이 논문은 다중화자 음성 변환에서 데이터 부족 문제를 해결하기 위해 대규모 단일 화자 TTS 데이터셋을 사전 훈련된 오토에인코더로 활용하는 계층적 시퀀스-투-시퀀스 음성 변환 모델을 제안한다. 메르 스펙트로그램을 입력 및 출력 표현으로 사용하고, 계층적 인코딩을 갖춘 어텐션 기반 인코더-디코더 아키텍처와 WaveNet 보코더를 적용함으로써, 제한된 병렬 훈련 데이터로도 고품질의 엔드 투 엔드 음성 변환을 달성한다.
We present a voice conversion solution using recurrent sequence to sequence modeling for DNNs. Our solution takes advantage of recent advances in attention based modeling in the fields of Neural Machine Translation (NMT), Text-to-Speech (TTS) and Automatic Speech Recognition (ASR). The problem consists of converting between voices in a parallel setting when {\it $$} audio pairs are available. Our seq2seq architecture makes use of a hierarchical encoder to summarize input audio frames. On the decoder side, we use an attention based architecture used in recent TTS works. Since there is a dearth of large multispeaker voice conversion databases needed for training DNNs, we resort to training the network with a large single speaker dataset as an autoencoder. This is then adapted for the smaller multispeaker voice conversion datasets available for voice conversion. In contrast with other voice conversion works that use $F_0$, duration and linguistic features, our system uses mel spectrograms as the audio representation. Output mel frames are converted back to audio using a wavenet vocoder.
연구 동기 및 목표
- 제한된 병렬 음성 변환 데이터셋 문제를 해결하기 위해 대규모 단일 화자 TTS 사전 훈련을 활용한다.
- 텍스트 전사나 강제 정렬이 필요 없는 엔드 투 엔드 음성 변환 시스템을 개발한다.
- F0나 지속 시간과 같은 프로소딕 특징에 의존하지 않고 메르 스펙트로그램 표현과 WaveNet 보코더를 사용해 고음질 음성 변환을 구현한다.
- 사전 훈련된 오토에인코더에서의 전이 학습을 통해 소규모 다중화자 음성 변환 데이터셋에 적응함을 보여준다.
- 계층적 인코더에서 스타일 불변 표현을 학습하고 디코더에서 대상 화자의 특징을 주입함으로써 화자 특화 음성 변환을 달성한다.
제안 방법
- 입력 메르 스펙트로그램 프레임을 압축하여 압축된, 맥락 인식 표현을 생성하기 위해 CBHG(컨볼루션 뱅크, 하이웨이, 게이트드 순환 유닛) 스택을 갖춘 계층적 양방향 GRU 인코더를 사용한다.
- 주요 인코더 이전에 퍼블릭 드롭아웃(0.5)이 적용된 프리넷을 사용하고, 커널 크기가 1~25인 컨볼루션 레이어와 맥스 풀링을 적용하여 계층적 특징을 추출한다.
- Tacotron에 영감을 받은 어텐션 기반 디코더를 사용하여, 잔차 연결과 드롭아웃(0.1)을 갖춘 GRU 레이어를 사용해 타겟 메르 스펙트로그램을 프레임 단위로 생성한다.
- 예측된 메르 스펙트로그램과 타겟 메르 스펙트로그램 간의 L1 손실을 최소화하는 최대 우도 추정을 사용해 모델을 훈련한다.
- 4개의 전치 컨볼루션 업샘플링 레이어와 확장 컨볼루션을 갖춘 WaveNet 보코더를 사용해 생성된 메르 스펙트로그램을 다시 음성으로 변환한다.
- 먼저 대규모 단일 화자 TTS 데이터셋에서 오토에인코더로 모델을 사전 훈련한 후, 소규모 다중화자 음성 변환 데이터셋에서 미세 조정함으로써 전이 학습을 수행한다.
실험 결과
연구 질문
- RQ1어떤가? 어텐션 기반 계층적 시퀀스-투-시퀀스 모델이 제한된 병렬 음성 데이터만으로도 고음질 음성 변환을 달성할 수 있는가?
- RQ2대규모 단일 화자 TTS 코퍼스에서의 사전 훈련이 소규모 타겟 데이터셋에서 음성 변환에 대해 자기지도 학습 초기화로써 얼마나 효과적인가?
- RQ3메르 스펙트로그램을 명시적 프로소딕 특징(F0, 지속 시간 등) 대신 사용할 경우 음성 변환 품질과 일반화 능력에 어떤 영향을 미치는가?
- RQ4계층적 인코딩이 원시 메르 스펙트로그램 시퀀스에서 음소 유사 콘텐츠 표현을 효과적으로 추출하여 화자 분리 성능을 향상시키는가?
- RQ5메르 스펙트로그램에 조건부로 설정된 WaveNet 보코더가 변환 출력에서 청각적으로 자연스러운 음성을 생성하는가?
주요 결과
- 대규모 단일 화자 TTS 데이터셋을 사전 훈련 소스로 활용함으로써 효과적인 전이 학습을 통해 고품질 음성 변환을 달성한다.
- 계층적 인코더는 입력 메르 스펙트로그램을 압축된, 콘텐츠 인식 표현으로 성공적으로 압축하여 화자 스타일 분리 모델링을 지원한다.
- 어텐션 기반 디코더는 강한 시간적 일관성을 가지며, WaveNet 보코더를 통과시킬 때 자연스러운 음성 출력을 생성한다.
- 텍스트 전사, 강제 정렬, 명시적 언어적 특징이 필요 없이 엔드 투 엔드 음성 변환을 수행함으로써 파이프라인을 단순화한다.
- 초기화 조정, 특히 CBHG 네트워크의 용량과 전략적 드롭아웃 배치가 소규모 데이터셋에서의 일반화 성능 향상과 과적합 감소에 큰 영향을 미친다.
- 포스트넷이 없음에도 불구하고 모델은 타당한 음성 변환을 생성하지만, 일부 출력 블러링 현상이 관찰되어 후처리 기법의 도입이 유익할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.