Skip to main content
QUICK REVIEW

[논문 리뷰] ConvS2S-VC: Fully convolutional sequence-to-sequence voice conversion

Hirokazu Kameoka, Kou Tanaka|arXiv (Cornell University)|2018. 11. 05.
Speech Recognition and Synthesis참고 문헌 61인용 수 20
한 줄 요약

이 논문은 주어진 음성의 화자 정체성, 톤 프로파일, 지속 시간을 동시에 학습하는 완전 컨볼루션형 시퀀스-투-시퀀스 음성 변환 모델인 ConvS2S-VC를 제안한다. 이는 조건부 배치 정규화를 적용한 어텐션 기반 인코더-디코더 아키텍처를 기반으로 하며, 객관적 및 주관적 평가에서 최신 기준을 초월하는 성능을 달성한다. 음질과 화자 유사도 측면에서 이전 방법들을 능가하며, 텍스트나 ASR 시스템의 보조 없이도 다수의 화자 간 유연한 다대다 변환과 실시간 변환을 가능하게 한다.

ABSTRACT

This paper proposes a voice conversion (VC) method using sequence-to-sequence (seq2seq or S2S) learning, which flexibly converts not only the voice characteristics but also the pitch contour and duration of input speech. The proposed method, called ConvS2S-VC, has three key features. First, it uses a model with a fully convolutional architecture. This is particularly advantageous in that it is suitable for parallel computations using GPUs. It is also beneficial since it enables effective normalization techniques such as batch normalization to be used for all the hidden layers in the networks. Second, it achieves many-to-many conversion by simultaneously learning mappings among multiple speakers using only a single model instead of separately learning mappings between each speaker pair using a different model. This enables the model to fully utilize available training data collected from multiple speakers by capturing common latent features that can be shared across different speakers. Owing to this structure, our model works reasonably well even without source speaker information, thus making it able to handle any-to-many conversion tasks. Third, we introduce a mechanism, called the conditional batch normalization that switches batch normalization layers in accordance with the target speaker. This particular mechanism has been found to be extremely effective for our many-to-many conversion model. We conducted speaker identity conversion experiments and found that ConvS2S-VC obtained higher sound quality and speaker similarity than baseline methods. We also found from audio examples that it could perform well in various tasks including emotional expression conversion, electrolaryngeal speech enhancement, and English accent conversion.

연구 동기 및 목표

  • 스펙트럼 특징뿐만 아니라 톤 프로파일, 지속 시간, 리듬까지도 유연하게 변환할 수 있는 음성 변환 방법을 개발하는 것.
  • 기존 VC 모델이 프로소디크 특징을 고정되거나 선형적으로 조정하는 한계를 보완하기 위해, 이를 통합된 시퀀스-투-시퀀스 변환의 일부로 모델링하는 것.
  • 단일 통합 모델을 통해 다대다 음성 변환을 가능하게 하여 데이터 효율성과 다양한 화자 간 일반화 능력을 향상시키는 것.
  • 실시간 추론을 가능하게 하기 위해 인과적 컨볼루션과 자동회귀 생성에 적합한 어텐션 메커니즘을 활용하는 것.
  • 텍스트 전사나 ASR 시스템에 의존하지 않기 위해 원시 음성 특징에 대해 엔드 투 엔드로 학습하는 것.

제안 방법

  • 디코더에서 인과적 컨볼루션을 사용하여 자동회귀적 생성을 가능하게 하는 완전 컨볼루션형 인코더-디코더 아키텍처를 사용한다.
  • 디코더가 입력 시퀀스의 관련 부분에 동적으로 어텐션을 집중할 수 있도록 어텐션 메커니즘을 적용하여 장거리 의존성을 포착한다.
  • 목표 화자 임베딩에 따라 적응적으로 스위칭되는 조건부 배치 정규화 레이어를 도입하여 효과적인 화자 분리가 가능하도록 한다.
  • 예측된 음성 특징과 목표 특징 간의 평균 제곱오차 손실을 사용하여 시퀀스-투-시퀀스 학습 프레임워크에 따라 엔드 투 엔드로 학습한다.
  • 모든 화자 쌍을 하나의 공통 모델이 처리함으로써, 다중 화자 학습 데이터로부터 공동으로 학습함으로써 다대다 변환을 가능하게 한다.
  • 인과성과 대각선 어텐션 매트릭스를 적용함으로써 어떤 화자에서나 다수의 화자로의 변환과 실시간 추론을 지원한다.

실험 결과

연구 질문

  • RQ1완전 컨볼루션형 시퀀스-투-시퀀스 모델이 음성 변환에서 스펙트럼, 톤, 지속 시간 특징을 통합적으로 효과적으로 학습할 수 있는가?
  • RQ2조건부 배치 정규화가 다대다 음성 변환에서 화자 분리와 성능 향상에 어떻게 기여하는가?
  • RQ3각 화자 쌍에 대해 별도의 모델이 필요 없이 단일 통합 모델이 다수의 화자 간에 얼마나 잘 일반화되는가?
  • RQ4주관적 청취 테스트에서 제안된 방법은 음질과 화자 유사도 측면에서 기준 방법 대비 어떻게 성능을 발휘하는가?
  • RQ5감정 표현 변환 및 억양 변환과 같은 비-신원 변환 작업으로도 모델이 일반화되는가?

주요 결과

  • 다대다 ConvS2S-VC 모델은 음질에 대해 MOS 4.31, 화자 유사도에 대해 MOS 4.42를 기록하여 RNN-S2S-VC 및 sprocket과 같은 기준 방법들을 크게 능가했다.
  • WORLD 합성 기반으로 자연스러움의 상한선에 매우 가까운 성능(MOS 4.54)을 달성하여 높은 청각적 품질을 입증했다.
  • 객관적 지표에서 다대다 작업에서 MCD는 6.37±0.04, LFC는 0.812를 기록하여 스펙트럼 및 프로소디크 정밀도 양면에서 뛰어난 성능을 보였다.
  • 인과적 컨볼루션과 대각선 어텐션을 적용한 실시간 시스템 설정은 성능 저하가 약간에 그쳐(MCD: 6.54±0.15, LFC: 0.797) 낮은 지연 응용에 실현 가능함을 입증했다.
  • 오디오 예시를 통해 모델이 감정 표현 변환, 전기라리지어스 음성 향상, 영어 억양 변환 등 비-신원 작업으로도 잘 일반화됨을 확인했다.
  • 제거 실험 결과 조건부 배치 정규화와 다대다 학습 체계 각각이 성능 향상에 크게 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.