[논문 리뷰] IQDUBBING: Prosody modeling based on discrete self-supervised speech representation for expressive voice conversion
이 논문은 VQ-Wav2Vec에서 유도한 이산 자기학습 음성 표현(DSSR)을 활용하여 발화자의 발성, 내용, 환경적 요소와 분리된 발성 특징을 모델링하는 새로운 표현력 있는 음성 변환 프레임워크인 IQDubbing을 제안한다. 두 가지 유형의 발성 필터—무작위 및 정렬된 다운샘플 필터—를 적용하여 발성 특징을 효과적으로 분리함으로써 최고 수준의 음성 품질(MOS 3.867), 높은 발성 일관성, 강한 발화자 유사도를 달성한다.
Prosody modeling is important, but still challenging in expressive voice conversion. As prosody is difficult to model, and other factors, e.g., speaker, environment and content, which are entangled with prosody in speech, should be removed in prosody modeling. In this paper, we present IQDubbing to solve this problem for expressive voice conversion. To model prosody, we leverage the recent advances in discrete self-supervised speech representation (DSSR). Specifically, prosody vector is first extracted from pre-trained VQ-Wav2Vec model, where rich prosody information is embedded while most speaker and environment information are removed effectively by quantization. To further filter out the redundant information except prosody, such as content and partial speaker information, we propose two kinds of prosody filters to sample prosody from the prosody vector. Experiments show that IQDubbing is superior to baseline and comparison systems in terms of speech quality while maintaining prosody consistency and speaker similarity.
연구 동기 및 목표
- 발화자, 내용, 환경적 요소와 얽힌 발성 특징을 모델링하는 표현력 있는 음성 변환의 과제를 해결한다.
- 기존 방법들이 비병렬 비표준 음성에서 발성 특징을 발화자 및 내용 정보로부터 분리하지 못하는 한계를 극복한다.
- 이산 자기학습 표현(DSSR)과 전용 발성 필터링 메커니즘을 활용하여 음성 변환의 음성 품질과 발성 일관성을 향상시킨다.
- 비병렬 환경에서 소스 발화자로부터 목표 발화자로 표현력 있는 발성 특징을 전달하면서도 높은 발화자 유사도를 유지한다.
- 두 가지 새로운 발성 필터—RDPF와 ADPF—가 발성 벡터를 정련하여 더 나은 분리와 성능을 달성하는 데 효과적인지 입증한다.
제안 방법
- 소스 음성에서 이산 자기학습 음성 표현(DSSR)을 추출하기 위해 미리 훈련된 VQ-Wav2Vec 모델을 사용하며, 벡터 양자화를 통해 발화자 및 환경 정보를 본질적으로 억제한다.
- 발성 인코더를 사용해 DSSR에서 발성 벡터를 추출하여 풍부한 발성 정보를 캡처하면서도 발화자 및 내용 누출을 최소화한다.
- 무작위 다운샘플 발성 필터(RDPF)와 정렬된 다운샘플 발성 필터(ADPF)의 두 가지 유형의 발성 필터를 적용하여, 관련 있는 발성 특징만을 샘플링함으로써 발성 벡터를 추가로 정련한다.
- ASR 박스 테이프 특징에서 언어적 내용을 추출하기 위한 컨텐츠 인코더, 발화자 신원을 추출하기 위한 발화자 인코더, 그리고 멜스펙트로그램을 재구성하기 위한 트랜스포머 기반의 자동회귀 디코더를 사용한다.
- Adam 옵timizer와 학습률 감소를 사용하여 전체 시스템을 훈련하고, 웨이브폼 합성에 Parallel WaveGAN을 사용한다.
- 컨텐츠, 발성, 발화자 벡터를 디코더의 입력으로 사용하여 시스템을 엔드 투 엔드로 최적화한다.
실험 결과
연구 질문
- RQ1VQ-Wav2Vec에서 유도한 이산 자기학습 음성 표현(DSSR)은 표현력 있는 음성 변환에서 발화자 및 환경 정보를 억제하면서도 발성 특징을 효과적으로 모델링할 수 있는가?
- RQ2제안된 발성 필터(RDPF 및 ADPF)는 발성 벡터 내의 내용 및 잔여 발화자 정보로부터 발성을 얼마나 효과적으로 분리하는가?
- RQ3IQDubbing 프레임워크는 표현력 있는 음성 변환에서 베이스라인 및 최고 수준의 기존 방법보다 뛰어난 음성 품질을 달성하는가?
- RQ4IQDubbing은 음성 변환 과정에서 발성 일관성과 발화자 유사도를 어느 정도 유지하는가?
- RQ5음성 품질과 발성 정확도 향상 측면에서 정렬된 다운샘플 발성 필터(ADPF)가 무작위 다운샘플 발성 필터(RDPF)보다 더 효과적인가?
주요 결과
- IQDubbing-ADPF는 평균 평가 점수(MOS) 3.867을 기록하여 기준 모델(3.733)과 비교 모델(3.267)을 상당히 앞서며 뛰어난 음성 품질을 입증한다.
- 발성 일관성에 대한 AB 테스트 결과, IQDubbing-ADPF는 IQDubbing-Base 및 IQDubbing-RDPF를 포함한 모든 기준 모델을 앞서며 소스 발성 특징을 효과적으로 유지하는 것으로 확인된다.
- 발화자 유사도에 대한 잘못 수용률(FAR)은 IQDubbing-ADPF가 0.830으로 기준 모델(0.833)과 유사하여, 발성 전달에도 불구하고 강력한 발화자 유사도를 유지하고 있음을 보여준다.
- IQDubbing-Base는 비교 모델(0.617)보다 더 높은 FAR(0.818)를 기록하여 DSSR 기반의 발성 모델링이 이전 방법보다 발화자 유사도를 향상시킨다는 것을 시사한다.
- RDPF 기반 변형(IQDubbing-RDPF)은 MOS 3.417로 IQDubbing-Base(3.750)보다 낮아 무작위 다운샘플링의 불안정성과 ADPF의 구조적 샘플링의 우월성을 보여준다.
- ADPF 필터는 RDPF보다 발성 벡터에서 내용 및 발화자 관련 정보를 더 효과적으로 제거하여 더 나은 음성 품질과 발성 일관성을 이끌어냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.