[논문 리뷰] AttS2S-VC: Sequence-to-Sequence Voice Conversion with Attention and Context Preservation Mechanisms
이 논문은 시간에 맞춰 정렬된 병렬 데이터나 발음 표기 없이도 음성 스펙트럼 은하, 기본 주파수 경로, 지속 시간을 종단 간(end-to-end)으로 변환할 수 있는 주의(attention) 및 맥락 보존 메커니즘을 갖춘 시퀀스-투-시퀀스 음성 변환 모델인 AttS2S-VC를 제안한다. 이 방법은 단일 GPU로 하루 만에 훈련이 가능하며, 전통적인 GMM 기반 VC보다 뛰어난 음성 품질을 달성했고, LSTM-TTS 성능과도 맞먹는다.
This paper describes a method based on a sequence-to-sequence learning (Seq2Seq) with attention and context preservation mechanism for voice conversion (VC) tasks. Seq2Seq has been outstanding at numerous tasks involving sequence modeling such as speech synthesis and recognition, machine translation, and image captioning. In contrast to current VC techniques, our method 1) stabilizes and accelerates the training procedure by considering guided attention and proposed context preservation losses, 2) allows not only spectral envelopes but also fundamental frequency contours and durations of speech to be converted, 3) requires no context information such as phoneme labels, and 4) requires no time-aligned source and target speech data in advance. In our experiment, the proposed VC framework can be trained in only one day, using only one GPU of an NVIDIA Tesla K80, while the quality of the synthesized speech is higher than that of speech converted by Gaussian mixture model-based VC and is comparable to that of speech generated by recurrent neural network-based text-to-speech synthesis, which can be regarded as an upper limit on VC performance.
연구 동기 및 목표
- 시간에 맞춰 정렬된 병렬 데이터에 의존하지 않고도 훈련을 안정화하고 가속화하는 음성 변환 시스템을 개발하는 것.
- 단일 종단 간 프레임워크 내에서 스펙트럼 은하, 기본 주파수 경로, 음성 지속 시간을 동시에 변환할 수 있도록 하는 것.
- 훈련 중에 발음 표기 또는 언어학적 텍스트가 필요 없도록 하는 것.
- 최소한의 감독 신호로 최신의 텍스트-투-음성 시스템 수준의 높은 품질의 음성 변환을 달성하는 것.
제안 방법
- 다양한 길이의 소스 및 타겟 시퀀스를 정렬하기 위해 주의(attention) 메커니즘을 활용한 인코더-디코더 아키텍처를 채택한다.
- 디코딩 중 소스 프레임의 관련 부분에 주의를 집중시키기 위해 주의 집중을 유도하는 손실 함수를 도입하여 훈련을 안정화시킨다.
- 소스 음성의 시간적 및 주파수적 맥락을 변환 중에도 유지하기 위해 맥락 보존 손실을 적용한다.
- 원시 음성 특징(Mel-cepstral 계수, log-F0, 비정규성)을 WORLD 음성합성기로 추출하여 종단 간 훈련을 수행한다.
- 정지 토큰을 생성하여 출력 시퀀스의 길이를 가변적으로 결정함으로써 다양한 길이의 출력 생성을 가능하게 한다.
- λ_cp, λ_ga, σ_g와 같은 하이퍼파라미터를 조정하여 맥락 보존, 주의 유도, 훈련 안정성 간의 균형을 맞춘다.
실험 결과
연구 질문
- RQ1주의 및 맥락 보존 기반의 시퀀스-투-시퀀스 모델이 시간에 맞춰 정렬된 병렬 데이터 없이도 안정적이고 빠른 훈련을 가능하게 할 수 있는가?
- RQ2이 모델은 발음 표기나 텍스트 없이도 스펙트럼 은하, F0 경로, 지속 시간을 동시에 변환할 수 있는가?
- RQ3제안된 방법이 기존의 GMM 기반 VC 시스템보다 더 높은 음성 품질을 제공하는가?
- RQ4제안된 모델의 성능은 자연스러움과 화자 유사도 측면에서 최신의 종단 간 텍스트-투-음성 시스템과 비교해 어떻게 되는가?
주요 결과
- 15명의 청취자들이 실시한 주관적 선호도 테스트 결과, 제안된 AttS2S-VC 모델은 자연스러움과 화자 유사도 측면에서 GMM 기반 VC를 모두 초월했다.
- LSTM 기반 텍스트-투-음성 시스템 수준의 음성 품질을 달성했으며, 이는 음성 변환 성능의 상한선으로 여겨진다.
- 단일 NVIDIA Tesla K80 GPU를 사용하여 하루 만에 훈련이 완료되어 높은 훈련 효율성을 입증했다.
- 기존의 프레임/시퀀스 기반 VC 시스템과 달리, 이 방법은 스펙트럼 특징뿐만 아니라 F0 경로와 지속 시간까지도 성공적으로 변환했다.
- 발음 표기나 시간에 맞춰 정렬된 소스-타겟 음성 쌍이 전혀 필요 없어 원시 음성 시퀀스에서 완전히 종단 간 학습이 가능했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.