Skip to main content
QUICK REVIEW

[논문 리뷰] MR-SVS: Singing Voice Synthesis with Multi-Reference Encoder

Shoutong Wang, Jinglin Liu|arXiv (Cornell University)|2022. 01. 11.
Music and Audio Processing인용 수 7
한 줄 요약

MR-SVS는 고정 크기의 스피커 인코더와 다중 헤드 어텐션 기반의 다중 레퍼런스 인코더를 결합하여 톤 색채 모델링을 향상시키는 제로샷 다중 스피커 노래 음성 합성 모델을 제안한다. 이 모델은 다수의 레퍼런스 오디오를 처리하여 세밀한 음성 특징을 포착한다. 또한 음정 일관성 문제를 해결하기 위해 음정 이동 기법을 도입하여 합성의 자연스러움과 스피커 유사도를 크게 향상시켰으며, MOS 평가를 통해 검증되었다.

ABSTRACT

Multi-speaker singing voice synthesis is to generate the singing voice sung by different speakers. To generalize to new speakers, previous zero-shot singing adaptation methods obtain the timbre of the target speaker with a fixed-size embedding from single reference audio. However, they face several challenges: 1) the fixed-size speaker embedding is not powerful enough to capture full details of the target timbre; 2) single reference audio does not contain sufficient timbre information of the target speaker; 3) the pitch inconsistency between different speakers also leads to a degradation in the generated voice. In this paper, we propose a new model called MR-SVS to tackle these problems. Specifically, we employ both a multi-reference encoder and a fixed-size encoder to encode the timbre of the target speaker from multiple reference audios. The Multi-reference encoder can capture more details and variations of the target timbre. Besides, we propose a well-designed pitch shift method to address the pitch inconsistency problem. Experiments indicate that our method outperforms the baseline method both in naturalness and similarity.

연구 동기 및 목표

  • 제로샷 노래 음성 합성에서 단일 레퍼런스, 고정 크기의 스피커 임베딩이 풀 톤 색채 세부 정보를 포착하지 못하고 음정 일관성 문제를 겪는 한계를 해결하기 위함.
  • 다양한 레퍼런스 오디오 클립을 활용하여 다중 헤드 어텐션 기반 인코더를 통해 음성 특징의 프레임 수준 변동을 포착함으로써 톤 색채 모델링을 향상시키기 위함.
  • 특히 성별 간 차이가 큰 경우에도 음정 일관성을 개선하기 위해, 생성된 음정을 대상 스피커의 평균 음정에 맞추기 위한 음정 이동 기법을 도입함으로써 음정 불일치 문제를 완화하기 위함.
  • 저자원 환경에서도 합성 품질을 크게 향상시키면서도 제로샷 방법의 효율성과 편의성을 유지하기 위함.

제안 방법

  • 다중 레퍼런스 인코더는 레퍼런스 오디오 클립을 멜-스펙트로그램으로 변환하고, 컨볼루션 및 양방향 LSTM 레이어를 거쳐 맥락 인식 표현을 추출한다.
  • 다중 레퍼런스 인코더는 다중 헤드 자기 어텐션을 사용하여 다양한 레퍼런스 오디오 간의 다양한 음성 특성에 주목함으로써 고해상도의 프레임 수준 임베딩을 계산한다. 쿼리, 키, 밸류 행렬은 은닉 상태에서 유도된다.
  • 고정 크기의 스피커 임베딩(레퍼런스 임베딩의 평균)과 프레임 수준의 다중 레퍼런스 임베딩을 조합하여 각 합성 프레임의 음성 모델을 조절한다.
  • 추론 단계에서 음정 이동 기법을 적용하여 입력 음정 컨투어를 대상 스피커의 평균 음정에 맞추어 조정함으로써 음정 일관성을 향상시킨다.
  • 전체 모델은 수정된 FastSpeech 2 아키텍처를 기반으로 하며, 음소, 지속 시간, 음정, 스피커 임베딩을 입력으로 받아 복원 손실을 최소화하는 방식으로 멜-스펙트로그램을 예측한다.

실험 결과

연구 질문

  • RQ1단일 고정 크기 임베딩 대비 다수의 레퍼런스 오디오를 처리하는 다중 레퍼런스 인코더가 제로샷 노래 음성 합성에서 톤 색채 표현을 향상시키는가?
  • RQ2다중 레퍼런스 인코더에 다중 헤드 어텐션을 적용할 경우, 다양한 노래 프레임 간의 세밀한 음성 변동을 더 잘 모델링할 수 있는가?
  • RQ3특히 성별 쌍 간에 발생하는 음정 일관성 문제로 인해 노래 음성 합성 품질이 얼마나 떨어지며, 이를 효과적으로 완화할 수 있는가?
  • RQ4고정 크기 임베딩과 다중 레퍼런스 인코더를 함께 사용할 경우, 각각을 별도로 사용할 때보다 자연스러움과 유사도 측면에서 성능이 어떻게 향상되는가?

주요 결과

  • MR-SVS 모델은 내성별 노래 합성에서 자연스러움에 대해 평균 평가 점수(MOS) 4.42 ± 0.03, 유사도에 대해 4.18 ± 0.03을 기록하여 기준 모델을 크게 능가한다.
  • 음정 이동 기법을 적용한 결과, 이성 간 변환에서 유사도 MOS가 0.15점 이상 향상되었으며, 예를 들어 3.51 ± 0.07에서 3.70 ± 0.05로 상승하여 음정 불일치 문제의 효과적인 완화를 입증했다.
  • 제거 실험 결과, 다중 레퍼런스 인코더만으로는 기준 모델보다 유사도 성능이 열 劣함을 확인하여 고정 크기의 임베딩이 전체 톤 색채 모델링에 필수적임을 시사한다.
  • 싱글 헤드 다중 레퍼런스 인코더는 기준 모델을 초월하지만, 다중 헤드 버전이 성능을 더욱 향상시켜 어텐션 메커니즘이 다양한 음성 특징을 효과적으로 포착함을 확인했다.
  • 모델은 제어 가능한 합성을 가능하게 하며, 입력 음정, 음소 또는 지속 시간을 수정함으로써 멜로디나 내용을 변경하면서도 스피커 정체성을 유지할 수 있어 새로운 창작 음악 제작 워크플로우를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.