[논문 리뷰] MR-SVS: Singing Voice Synthesis with Multi-Reference Encoder
MR-SVS는 고정 크기의 스피커 인코더와 다중 헤드 어텐션 기반의 다중 레퍼런스 인코더를 결합하여 톤 색채 모델링을 향상시키는 제로샷 다중 스피커 노래 음성 합성 모델을 제안한다. 이 모델은 다수의 레퍼런스 오디오를 처리하여 세밀한 음성 특징을 포착한다. 또한 음정 일관성 문제를 해결하기 위해 음정 이동 기법을 도입하여 합성의 자연스러움과 스피커 유사도를 크게 향상시켰으며, MOS 평가를 통해 검증되었다.
Multi-speaker singing voice synthesis is to generate the singing voice sung by different speakers. To generalize to new speakers, previous zero-shot singing adaptation methods obtain the timbre of the target speaker with a fixed-size embedding from single reference audio. However, they face several challenges: 1) the fixed-size speaker embedding is not powerful enough to capture full details of the target timbre; 2) single reference audio does not contain sufficient timbre information of the target speaker; 3) the pitch inconsistency between different speakers also leads to a degradation in the generated voice. In this paper, we propose a new model called MR-SVS to tackle these problems. Specifically, we employ both a multi-reference encoder and a fixed-size encoder to encode the timbre of the target speaker from multiple reference audios. The Multi-reference encoder can capture more details and variations of the target timbre. Besides, we propose a well-designed pitch shift method to address the pitch inconsistency problem. Experiments indicate that our method outperforms the baseline method both in naturalness and similarity.
연구 동기 및 목표
- 제로샷 노래 음성 합성에서 단일 레퍼런스, 고정 크기의 스피커 임베딩이 풀 톤 색채 세부 정보를 포착하지 못하고 음정 일관성 문제를 겪는 한계를 해결하기 위함.
- 다양한 레퍼런스 오디오 클립을 활용하여 다중 헤드 어텐션 기반 인코더를 통해 음성 특징의 프레임 수준 변동을 포착함으로써 톤 색채 모델링을 향상시키기 위함.
- 특히 성별 간 차이가 큰 경우에도 음정 일관성을 개선하기 위해, 생성된 음정을 대상 스피커의 평균 음정에 맞추기 위한 음정 이동 기법을 도입함으로써 음정 불일치 문제를 완화하기 위함.
- 저자원 환경에서도 합성 품질을 크게 향상시키면서도 제로샷 방법의 효율성과 편의성을 유지하기 위함.
제안 방법
- 다중 레퍼런스 인코더는 레퍼런스 오디오 클립을 멜-스펙트로그램으로 변환하고, 컨볼루션 및 양방향 LSTM 레이어를 거쳐 맥락 인식 표현을 추출한다.
- 다중 레퍼런스 인코더는 다중 헤드 자기 어텐션을 사용하여 다양한 레퍼런스 오디오 간의 다양한 음성 특성에 주목함으로써 고해상도의 프레임 수준 임베딩을 계산한다. 쿼리, 키, 밸류 행렬은 은닉 상태에서 유도된다.
- 고정 크기의 스피커 임베딩(레퍼런스 임베딩의 평균)과 프레임 수준의 다중 레퍼런스 임베딩을 조합하여 각 합성 프레임의 음성 모델을 조절한다.
- 추론 단계에서 음정 이동 기법을 적용하여 입력 음정 컨투어를 대상 스피커의 평균 음정에 맞추어 조정함으로써 음정 일관성을 향상시킨다.
- 전체 모델은 수정된 FastSpeech 2 아키텍처를 기반으로 하며, 음소, 지속 시간, 음정, 스피커 임베딩을 입력으로 받아 복원 손실을 최소화하는 방식으로 멜-스펙트로그램을 예측한다.
실험 결과
연구 질문
- RQ1단일 고정 크기 임베딩 대비 다수의 레퍼런스 오디오를 처리하는 다중 레퍼런스 인코더가 제로샷 노래 음성 합성에서 톤 색채 표현을 향상시키는가?
- RQ2다중 레퍼런스 인코더에 다중 헤드 어텐션을 적용할 경우, 다양한 노래 프레임 간의 세밀한 음성 변동을 더 잘 모델링할 수 있는가?
- RQ3특히 성별 쌍 간에 발생하는 음정 일관성 문제로 인해 노래 음성 합성 품질이 얼마나 떨어지며, 이를 효과적으로 완화할 수 있는가?
- RQ4고정 크기 임베딩과 다중 레퍼런스 인코더를 함께 사용할 경우, 각각을 별도로 사용할 때보다 자연스러움과 유사도 측면에서 성능이 어떻게 향상되는가?
주요 결과
- MR-SVS 모델은 내성별 노래 합성에서 자연스러움에 대해 평균 평가 점수(MOS) 4.42 ± 0.03, 유사도에 대해 4.18 ± 0.03을 기록하여 기준 모델을 크게 능가한다.
- 음정 이동 기법을 적용한 결과, 이성 간 변환에서 유사도 MOS가 0.15점 이상 향상되었으며, 예를 들어 3.51 ± 0.07에서 3.70 ± 0.05로 상승하여 음정 불일치 문제의 효과적인 완화를 입증했다.
- 제거 실험 결과, 다중 레퍼런스 인코더만으로는 기준 모델보다 유사도 성능이 열 劣함을 확인하여 고정 크기의 임베딩이 전체 톤 색채 모델링에 필수적임을 시사한다.
- 싱글 헤드 다중 레퍼런스 인코더는 기준 모델을 초월하지만, 다중 헤드 버전이 성능을 더욱 향상시켜 어텐션 메커니즘이 다양한 음성 특징을 효과적으로 포착함을 확인했다.
- 모델은 제어 가능한 합성을 가능하게 하며, 입력 음정, 음소 또는 지속 시간을 수정함으로써 멜로디나 내용을 변경하면서도 스피커 정체성을 유지할 수 있어 새로운 창작 음악 제작 워크플로우를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.