[논문 리뷰] Towards Fine-Grained Prosody Control for Voice Conversion
이 논문은 비병렬 음성 변환 프레임워크를 제안하며, 비지도 학습된 프로소디 임베딩을 사용하여 세밀한 프로소디 제어를 가능하게 하여 음질 향상과 화자 유사도 향상을 이룹니다. 특히 노래 조건에서 성능 향상이 두드러지며, 음높이 기반 프로소디 제어를 학습된 임베딩으로 대체하고 실시간 LPCNet 음성합성기(보정기)를 활용하여 고해상도 음성 합성을 구현합니다.
In a typical voice conversion system, prior works utilize various acoustic features (e.g., the pitch, voiced/unvoiced flag, aperiodicity) of the source speech to control the prosody of generated waveform. However, the prosody is related with many factors, such as the intonation, stress and rhythm. It is a challenging task to perfectly describe the prosody through acoustic features. To deal with this problem, we propose prosody embeddings to model prosody. These embeddings are learned from the source speech in an unsupervised manner. We conduct experiments on our Mandarin corpus recoded by professional speakers. Experimental results demonstrate that the proposed method enables fine-grained control of the prosody. In challenging situations (such as the source speech is a singing song), our proposed method can also achieve promising results.
연구 동기 및 목표
- 음성 변환에서 음높이 기반 프로소디 제어의 한계를 해결하기 위해, 조절이 어려운 복잡한 프로소디적 요소(예: 음조, 강세, 리듬)를 포괄하지 못하는 문제를 해결한다.
- 수동으로 설정한 음향 특징 대신 비지도 프로소디 임베딩을 사용하여 비병렬 음성 변환에서 음질과 화자 유사도를 향상시킨다.
- LPCNet 신경 보정기를 사용하여 실시간 고해상도 음성 합성을 실현하며, 기존의 파arametric 보정기보다 더 나은 스펙트럼 제어와 효율성을 제공한다.
- 제안된 방법이 표준 TTS 스타일 음성과 함께 노래 조건에서도 평가되어 다양한 프로소디 패턴에 대한 강건성을 입증한다.
제안 방법
- 신경망을 사용하여 소스 음성에서 비지도 방식으로 프로소디 임베딩을 학습하며, 명시적 애너테이션 없이도 복잡한 프로소디적 특징을 포괄한다.
- 프레임워크는 언어적 입력으로 피텔로지(Posteriorgrams, PPGs)를 사용하고, CBHG 기반의 변환 모델을 통해 목표 화자 음향 특징으로 매핑한다.
- 프로소디 임베딩은 PPGs와 결합되어 음향 특징 생성 과정을 안내하는 조건부 입력으로 사용된다.
- 음성 웨이브폼은 LPCNet을 사용하여 합성되며, 이는 선형 예측과 RNN 기반으로 자극 신호를 예측하는 실시간 신경 보정기로, 스펙트럼 정밀도를 향상시킨다.
- 시스템은 Adam 옵timizer를 사용하여 엔드 투 엔드로 훈련되며, 배치 크기 32, 기울기 클리핑을 적용하고, 수렴을 위해 100,000 스텝을 사용한다.
- 비교를 위해 음높이와 VUV(Voiced/Unvoiced)를 사용하는 베이스라인 시스템과 제안된 방법, 그리고 WORLD 보정기를 사용하는 PPG 기반의 베이스라인(C1)을 비교한다.
실험 결과
연구 질문
- RQ1비지도 프로소디 임베딩이 음높이를 초월해 음조, 강세, 리듬과 같은 복잡한 프로소디적 요소를 효과적으로 모델링할 수 있는가?
- RQ2수동으로 설정한 음높이 기반 프로소디 제어를 학습된 임베딩으로 대체할 경우, 비병렬 음성 변환에서 음질과 화자 유사도가 향상되는가?
- RQ3제안된 프레임워크는 LPCNet을 사용하여 고해상도 실시간 음성 합성을 달성할 수 있는가, 특히 도전적인 노래 조건에서 성능이 뛰어나게 되는가?
- RQ4기존의 PPG 기반 비병렬 VC 시스템과 비교해 볼 때, 제안된 방법은 주관적 음질과 화자 유사도 측면에서 더 낫게 평가되는가?
주요 결과
- 제안된 방법은 노래에서 말로의 변환(SONG-to-TS 쌍)에서 음높이 기반 베이스라인을 크게 능가하며, 더 나은 프로소디 제어 능력을 입증한다.
- 주관적 MOS 평가 결과, 제안된 방법은 CMU-ARCTIC 및 중국어 데이터셋 양쪽에서 베이스라인 및 C1 시스템보다 더 자연스러운 음성 품질을 확보한다.
- Same/Different 파라디그마 결과에 따르면, 제안된 방법은 특히 비음성 프로소디 조건에서 베이스라인보다 더 높은 화자 유사도를 달성한다.
- LPCNet은 음질과 화자 유사도 측면에서 WORLD 보정기보다 뛰어나며, 실시간 고해상도 합성에 효과적임을 확인한다.
- 노래 조건에서 제안된 방법은 높은 성능을 기록하며, 음높이 검출 오류와 부족한 프로소디 모델링으로 인해 음높이 기반 제어가 실패하는 상황에서도 효과적이다.
- 작은 블로킹 크기의 1D 프로소디 임베딩을 사용함으로써 병렬 데이터나 명시적 애너테이션 없이도 효과적이고 세밀한 프로소디 전달이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.