Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarially Trained Multi-Singer Sequence-To-Sequence Singing Synthesizer

Jie Ying Wu, Jian Luan|arXiv (Cornell University)|2020. 06. 18.
Music and Audio Processing참고 문헌 31인용 수 8
한 줄 요약

이 논문은 적은 양의 목표 가수 데이터로도 다양한 가수 데이터를 활용하여 음질을 향상시키는 적대적 훈련을 거친 다중 가수 시퀀스-투-시퀀스 노래 합성기 모델을 제안한다. 가수 분류기를 통해 가수에 종속된 표현을 감소시키고, 다중 랜덤 윈도우 판별기(MRWDs)를 사용하여 현실감과 발음의 정확성을 향상시켜 4.12의 MOS 점수를 기록하였다. 이는 기준 모델(3.53)을 크게 앞서며, 특히 높은 도르의 모음자 발음의 명확성이 크게 향상되었다.

ABSTRACT

This paper presents a high quality singing synthesizer that is able to model a voice with limited available recordings. Based on the sequence-to-sequence singing model, we design a multi-singer framework to leverage all the existing singing data of different singers. To attenuate the issue of musical score unbalance among singers, we incorporate an adversarial task of singer classification to make encoder output less singer dependent. Furthermore, we apply multiple random window discriminators (MRWDs) on the generated acoustic features to make the network be a GAN. Both objective and subjective evaluations indicate that the proposed synthesizer can generate higher quality singing voice than baseline (4.12 vs 3.53 in MOS). Especially, the articulation of high-pitched vowels is significantly enhanced.

연구 동기 및 목표

  • 목표 가수의 훈련 데이터가 제한적인 상황에서, 다양한 가수의 공유 데이터를 활용한 다중 가수 훈련을 통해 개인 맞춤 노래 음성 생성 문제를 해결하기 위해.
  • 음악 점수와 보컬 레코딩의 분포가 불균형한 데 기인한 가수 간 데이터 불균형 문제를 완화하기 위해.
  • 적대적 훈련을 통해 합성된 노래 음성의 현실감과 발음 정확성을 향상시키며, 특히 높은 도르의 모음자에 초점을 맞추기 위해.
  • 피드포워드 시퀀스-투-시퀀스 트랜스포머 아키텍처를 다중 가수 환경으로 확장하여 추론 시간과 노출 오차를 감소시키기 위해.
  • 분리된 가수 표현과 GAN 기반 생성을 통해 최소한의 목표 가수 데이터로도 고품질의 개인 맞춤형 노래 음성 합성 구현을 가능하게 하기 위해.

제안 방법

  • 가정 가수 임베딩을 사용하여 트랜스포머 기반의 시퀀스-투-시퀀스 노래 합성기를 다중 가수 지원으로 확장한다.
  • 에코더 출력에서 가수 신원 정보를 최소화하기 위해 적대적 헤드로 가수 분류기를 도입하여, 가수에 독립적인 표현 학습을 촉진한다.
  • 생성된 음성 특징의 국소 세그먼트에 다중 랜덤 윈도우 판별기(MRWDs)를 적용하여 다양한 시간 척도에서 세밀한 현실감 평가를 가능하게 한다.
  • MRWDs는 전체 오디오에서 무작위로 샘플된 부분 시퀀스에 대해 조건부 및 무조건적 판별기를 병렬로 운영하여 일반화 능력과 다양성을 향상시킨다.
  • 진짜 발음 시간과 WORLD 보코더 특징(MGC, BAP, F0)을 사용하여 지속시간 모델링과 스펙트럼 품질에 집중하기 위해 분리한다.
  • 가수 분류기와 MRWDs를 결합한 GAN 프레임워크를 통해 적대적 훈련을 수행하여, 가수에 불변인 인코딩과 현실적인 음성 생성을 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1목표 가수의 데이터가 제한적인 상황에서, 다중 가수 데이터로 훈련된 시퀀스-투-시퀀스 노래 합성기가 단일 가수 기준 모델보다 더 높은 음질을 달성할 수 있는가?
  • RQ2가수 분류기를 활용한 적대적 훈련이 에코더 출력에서 가수에 종속된 표현을 효과적으로 감소시켜, 가수 간 데이터 불균형 문제를 완화하는가?
  • RQ3다중 랜덤 윈도우 판별기(MRWDs)가 단일 판별기 GAN보다 생성된 음성 특징의 현실감을 향상시키고 과도한 부드러움을 줄이는가?
  • RQ4제안된 방법이 높은 도르의 모음자 발음에 대해 얼마나 향상된 발음 정확성을 제공하는가? 이는 노래 합성에서 널리 알려진 도전 과제이다.
  • RQ5가수 분류기와 MRWDs를 결합했을 때 주관적 및 객관적 평가 지표에서 상호보완적인 성능 향상이 이루어지는가?

주요 결과

  • 제안된 모델은 평균 평가 점수(MOS) 4.12를 기록하여 기준 시스템(3.53)을 뚜렷이 앞서는 뛰어난 음질을 입증하였다.
  • A/B 선호도 테스트에서 가수 분류기를 포함한 시스템이 통계적으로 유의미한 우위를 보였다(p < 0.001), 특히 높은 도르의 모음자 발음에서 두드러졌다.
  • 가수 분류기와 MRWDs의 조합(Sysytem5)은 높은 도르의 모음자('qi a_h nn_h')에 대해 뚜렷한 하모닉스를 보이는 가장 선명한 멜-스펙트로그램을 생성하였다.
  • MRWDs가 과도한 부드러움을 효과적으로 줄였으며, 진짜 값에 가까운 전역 분산(GV) 경로로 확인되었다.
  • 다중 가수 모듈은 목표 가수 데이터가 적은 경우에도 성능 향상을 이끌어내었으며, 단일 가수 기준 모델과 비교해 유사하거나 더 좋은 GV 및 MOS 점수를 기록하였다.
  • 가수 분류기는 GV에 거의 영향을 주지 않았지만, 특히 높은 도르의 모음자와 같은 희소 입력 조건에서 청각적 품질을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.