[논문 리뷰] DeepSinger: Singing Voice Synthesis with Data Mined From the Web
DeepSinger는 스튜디오 녹음이나 수동 정렬 없이 웹에서 수집한 데이터만으로 훈련하는 多국어, 다수의 가수를 지원하는 노래 음성 합성 시스템이다. 새로운 어휘-노래 정렬 모델과 참조 인코더를 갖춘 피드포워드 트랜스포머를 사용하여, 높은 품질의 자연스러운 음성으로 가사에서 직접 음성 생성을 수행하며, 노이즈가 있는 훈련 데이터에서도 뛰어난 음고 정확도와 음질을 달성한다.
In this paper, we develop DeepSinger, a multi-lingual multi-singer singing voice synthesis (SVS) system, which is built from scratch using singing training data mined from music websites. The pipeline of DeepSinger consists of several steps, including data crawling, singing and accompaniment separation, lyrics-to-singing alignment, data filtration, and singing modeling. Specifically, we design a lyrics-to-singing alignment model to automatically extract the duration of each phoneme in lyrics starting from coarse-grained sentence level to fine-grained phoneme level, and further design a multi-lingual multi-singer singing model based on a feed-forward Transformer to directly generate linear-spectrograms from lyrics, and synthesize voices using Griffin-Lim. DeepSinger has several advantages over previous SVS systems: 1) to the best of our knowledge, it is the first SVS system that directly mines training data from music websites, 2) the lyrics-to-singing alignment model further avoids any human efforts for alignment labeling and greatly reduces labeling cost, 3) the singing model based on a feed-forward Transformer is simple and efficient, by removing the complicated acoustic feature modeling in parametric synthesis and leveraging a reference encoder to capture the timbre of a singer from noisy singing data, and 4) it can synthesize singing voices in multiple languages and multiple singers. We evaluate DeepSinger on our mined singing dataset that consists of about 92 hours data from 89 singers on three languages (Chinese, Cantonese and English). The results demonstrate that with the singing data purely mined from the Web, DeepSinger can synthesize high-quality singing voices in terms of both pitch accuracy and voice naturalness (footnote: Our audio samples are shown in https://speechresearch.github.io/deepsinger/.)
연구 동기 및 목표
- 고가의 인간 녹음과 수동 데이터 레이블링을 회피하는 음성 합성 시스템을 개발하는 것.
- 훈련을 위해 음악 웹사이트에서 직접 대규모 음악 데이터를 채굴하고 활용하는 것.
- 인간의 주석 없이 음소 수준에서 어휘를 음악에 정렬하는 자동화된 정렬 시스템을 설계하는 것.
- 노이즈가 있는 실제 세계의 음성 데이터로부터 학습할 수 있는 강력한 음성 모델을 구축하는 것.
- 단일 통합 모델을 통해 다국어 및 다수의 가수 음성 합성을 가능하게 하는 것.
제안 방법
- 다양한 언어의 음악 웹사이트에서 인기 곡을 크롤링하여 수집한다.
- Spleeter를 사용해 수집된 오디오에서 보컬 음성과 악기 음악을 분리한다.
- 문장 수준의 어휘와 오디오에서 음소 수준의 지속 시간을 예측하기 위해 계층적 정렬 모델을 훈련한다.
- 참조 인코더를 사용해 가수의 톤을 모델링하고, 가사에서 직접 선형 스펙트로그램을 생성하는 피드포워드 트랜스포머 기반의 음성 합성 모델을 사용한다.
- 생성된 스펙트로그램에서 웨이브폼을 복원하기 위해 Griffin-Lim을 사용한다.
- 모델은 중국어, 광둥어, 영어에서 약 92시간 분량의 89명의 가수로부터 수집한 데이터셋으로 훈련된다.
실험 결과
연구 질문
- RQ1스튜디오 녹음이나 수동 주석 없이 웹에서 채굴한 데이터만으로도 고품질의 음성 합성 시스템을 훈련시킬 수 있는가?
- RQ2자동화된 다단계 정렬 모델이 SVS에서 인간 주석 정렬을 얼마나 효과적으로 대체할 수 있는가?
- RQ3참조 인코더 기반 모델이 노이즈가 많은 실제 세계의 음성 데이터로부터 가수 특유의 톤을 효과적으로 학습할 수 있는가?
- RQ4다국어 미리 훈련이 개별 언어의 성능을 떨어뜨리거나 향상시키는가?
- RQ5웹에서 채굴한 음성 데이터를 사용하는 것과 TTS 데이터만을 보조 훈련에 사용하는 것과의 성능 비교는 어떻게 되는가?
주요 결과
- DeepSinger는 합성된 노래 음성에 대해 평균 평가 점수(MOS)가 3.78로, 기준점인 4.38에 가깝게 높은 음질을 달성하여 자연스러움이 뛰어나다.
- 참조 인코더가 있는 모델은 노이즈가 있는 훈련 데이터에서 더 우수한 성능을 보이며, 노이즈 있는 기준 음성에서 MOS 3.27, 정상적인 경우 3.42를 기록한다.
- 기준 모델 대비 DeepSinger의 선호도 점수는 65.00%로, 오직 TTS 데이터로 훈련된 모델의 19.50%보다 유의미하게 높아, 음성 특화 데이터의 중요성을 입증한다.
- 다국어 훈련은 개별 언어의 성능을 떨어뜨리지 않으며, 모델은 교차 언어 음성 합성을 성공적으로 지원한다.
- 청결한 데이터로 훈련된 모델는 청결한 기준 음성에서 노이즈가 있는 데이터로 훈련된 모델와 거의 유사한 성능을 보이며, 데이터 노이즈에 대한 강건성을 입증한다.
- 참조 인코더는 훈련 데이터가 불완전하더라도 다양한 노이즈 수준과 가수 스타일 간의 일반화를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.