[논문 리뷰] Towards achieving robust universal neural vocoding
이 논문은 17개의 언어에서 74명의 다양한 화자에 대해 훈련된, 화자에 종속되지 않은 WaveRNN 기반 신경 음성합성기(네트워크)를 제안하며, 명시적인 화자 인코딩 없이 스튜디오 수준의 음성에서 98%의 상대적 MUSHRA 점수를 달성한다. 이 모델은 예측할 수 없는 화자, 언어, 노래, 비음성 음성에 대해 강력한 일반화 능력을 보이며, 저품질 또는 도메인 외 조건에서도 화자에 종속된 음성합성기보다 우수한 성능을 보이지만, 소음이나 극단적인 음성 표현에서는 품질이 저하된다.
This paper explores the potential universality of neural vocoders. We train a WaveRNN-based vocoder on 74 speakers coming from 17 languages. This vocoder is shown to be capable of generating speech of consistently good quality (98% relative mean MUSHRA when compared to natural speech) regardless of whether the input spectrogram comes from a speaker or style seen during training or from an out-of-domain scenario when the recording conditions are studio-quality. When the recordings show significant changes in quality, or when moving towards non-speech vocalizations or singing, the vocoder still significantly outperforms speaker-dependent vocoders, but operates at a lower average relative MUSHRA of 75%. These results are shown to be consistent across languages, regardless of them being seen during training (e.g. English or Japanese) or unseen (e.g. Wolof, Swahili, Ahmaric).
연구 동기 및 목표
- 신경 음성합성기가 명시적인 화자 인코딩 없이도 유니버설한 강건성을 달성할 수 있는지 조사하기.
- 노래 및 비음성 음성 포함, 예측할 수 없는 화자, 언어, 음성 스타일에 대한 일반화 능력을 평가하기.
- 다양한 다중화자, 다중언어 데이터로 훈련하면 화자에 종속된 모델보다 더 나은 일반화 능력을 갖출 수 있는지 확인하기.
- 소음, 반향, 저품질 등의 열악한 기록 조건에서의 성능 평가하기.
- 표준 TTS 시나리오를 초월한 신경 음성합성기의 일반화 한계 탐색하기.
제안 방법
- 멜스펙트로그램을 입력으로 사용하고 10비트 무선법 웨이브폼 샘플을 예측하는 WaveRNN 기반 음성합성기(RNN_MS)를 17개 언어의 74명 화자에 대해 훈련시켰다.
- 멜스펙트로그램을 처리하기 위해 양방향 GRU 조건부 네트워크를 사용하고, 자동적으로 순차적으로 웨이브폼을 생성하기 위해 단방향 GRU를 사용했다.
- 모든 화자 임베딩 또는 one-hot 인코딩 없이, 오직 스펙트로그램 조건부에 의존하여 훈련했다.
- 다양한 설정에서 모델 성능을 평가하기 위해 화자에 종속된(SD), 다중화자(3Spk, 7Spk), 유니버설(Univ) 음성합성기 모델을 구성했다.
- 음성합성 성능를 스펙트로그램 추정 오차로부터 분리하기 위해 실제 기록에서 나온 오라클 스펙트로그램을 적용했다.
- 다양한 조건에서 자연 음성과의 품질 비교를 정량적으로 평가하기 위해 MUSHRA 점수를 사용했다.
실험 결과
연구 질문
- RQ1신경 음성합성기가 명시적인 화자 인코딩 없이도 고품질의 유니버설 음성합성 구현이 가능한가?
- RQ2다양한 화자와 언어로 훈련된 음성합성기는 예측할 수 없는 화자와 언어로의 일반화 능력이 얼마나 뛰어난가?
- RQ3소음, 반향, 저품질 등의 열악한 기록 조건에서 유니버설 음성합성기의 성능은 어떠한가?
- RQ4비음성 음성(예: 흥성, 외침 등)과 노래, 특히 왜곡되거나 복잡한 음성 품질을 가진 경우 음성합성기는 어떻게 대처하는가?
- RQ5다양한 데이터로 훈련하면 화자에 종속된 모델 대비 일반화 능력 향상 정도는 어느 정도인가?
주요 결과
- 유니버설 음성합성기는 훈련 중에 볼 수 없었던 화자나 언어일지라도 스튜디오 수준의 음성에서 항상 98%의 상대적 MUSHRA 점수를 기록했다.
- 비음성 음성과 같은 예측 불가능한 시나리오에서는 평균 72%의 상대적 MUSHRA 점수를 기록했으며, 이는 화자에 종속된 모델보다 뚜렷이 뛰어났다.
- 노래의 경우, 청소된 발라드에서는 94.5%의 상대적 MUSHRA 점수를 기록했지만, 왜곡된 스타일(예: 록)은 39.3%로 떨어져 음성 품질에 민감한 것으로 나타났다.
- 소음이나 반향 조건에서는 성능이 78%의 상대적 MUSHRA로 저하되었고, 소음과 반향이 동시에 존재하는 조건에서는 58%로 더 낮아졌다.
- 와플로프, 스포아릴리, 아مهر리카 등 다양한 언어에서의 성능이 일관되게 유지되어 강력한 다국어 일반화 능력을 보였다.
- 저품질 입력에서는 진동 효과 유사한 왜곡과 음성 유사한 잡음 아티팩트가 나타나, 비음성 음향을 모델링하는 데 한계가 있음을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.