Skip to main content
QUICK REVIEW

[논문 리뷰] VQVAE Unsupervised Unit Discovery and Multi-scale Code2Spec Inverter for Zerospeech Challenge 2019

Andros Tjandra, Berrak Şişman|arXiv (Cornell University)|2019. 05. 27.
Speech Recognition and Synthesis참고 문헌 25인용 수 12
한 줄 요약

이 논문은 ZeroSpeech 2019 챌린지에서 비음성 및 음소 레이블 없이 무 supervision으로 음성 단위를 발견하고 제로샷 음성 변환을 수행하는 VQ-VAE 기반 시스템을 제안한다. 벡터 양자화를 통해 이산 단위를 발견하고, MSE 및 적대적 손실로 훈련된 다중 척도 Code2Spec 인버터를 활용함으로써, ABX 점수(23.59), 비트레이트(400), 음성 자연스러움에서 최신 기술을 초월하는 성능을 달성하였으며, 이해 가능성과 청취 품질 측면에서 베이스라인 및 톱라인 시스템을 모두 능가하였다.

ABSTRACT

We describe our submitted system for the ZeroSpeech Challenge 2019. The current challenge theme addresses the difficulty of constructing a speech synthesizer without any text or phonetic labels and requires a system that can (1) discover subword units in an unsupervised way, and (2) synthesize the speech with a target speaker's voice. Moreover, the system should also balance the discrimination score ABX, the bit-rate compression rate, and the naturalness and the intelligibility of the constructed voice. To tackle these problems and achieve the best trade-off, we utilize a vector quantized variational autoencoder (VQ-VAE) and a multi-scale codebook-to-spectrogram (Code2Spec) inverter trained by mean square error and adversarial loss. The VQ-VAE extracts the speech to a latent space, forces itself to map it into the nearest codebook and produces compressed representation. Next, the inverter generates a magnitude spectrogram to the target voice, given the codebook vectors from VQ-VAE. In our experiments, we also investigated several other clustering algorithms, including K-Means and GMM, and compared them with the VQ-VAE result on ABX scores and bit rates. Our proposed approach significantly improved the intelligibility (in CER), the MOS, and discrimination ABX scores compared to the official ZeroSpeech 2019 baseline or even the topline.

연구 동기 및 목표

  • 저자원 언어를 위한 텍스트 및 음소 레이블 없이 음성 합성기를 구축하는 문제를 해결하기 위해.
  • 번역 없이 원시 음성에서 비지도 방식으로 자소 단위를 발견하기 위해.
  • ABX 분류 성능, 비트레이트 압축, 음성 자연스러움/이해 가능성 사이의 균형 잡힌 트레이드오프를 달성하기 위해.
  • 엔드 투 엔드 TTS 성능에서 ZeroSpeech 2019 공식 베이스라인 및 톱라인 시스템을 능가하기 위해.

제안 방법

  • 원시 음성 특징을 이산 코드북 벡터로 매핑하기 위해 스피커 임베딩을 조건으로 하는 조건부 VQ-VAE를 사용하여 비지도 단위 발견을 가능하게 하였다.
  • VQ-VAE는 256개의 코드북을 사용하며, 스트라이드 컨볼루션을 통해 시간 해상도를 4배로 감소시키고, 훈련 안정화를 위해 커밋먼트 손실을 적용하였다.
  • 다중 척도 Code2Spec 인버터는 다중 커널 크기의 1D 컨볼루션과 LSGAN 적대적 훈련을 사용하여 코드북 시퀀스에서 매그니튜드 스펙트로그램을 생성한다.
  • 인버터는 스피커 임베딩에 조건을 두고, 평균 제곱오차와 LSGAN 손실로 훈련되어 스펙트로그램 정밀도와 음성 변환 품질을 향상시켰다.
  • PyTorch에서 Adam 옵timizer를 사용하여 엔드 투 엔드로 훈련되었으며, 다른 음성 세트(영어 및 놀라움)에 대해 별도의 인버터를 사용하였다.
  • WaveNet 및 GAN 기반 음성 변환과 같은 후처리 기법을 시도하였지만, 코드북에서 생성된 특징에 내재된 왜곡으로 인해 효과가 없었다.

실험 결과

연구 질문

  • RQ1VQ-VAE는 K-평균 및 GMM과 같은 전통적 클러스터링 방법보다 저자원 음성에 대한 비지도 단위 발견에서 더 우수한 성능을 낼 수 있는가?
  • RQ2표준 인버터와 비교해 다중 척도 Code2Spec 인버터는 스펙트로그램 복원 및 음성 변환 품질을 어떻게 향상시키는가?
  • RQ3완전히 비지도 TTS 시스템에서 ABX 점수, 비트레이트, 음성 품질 간 최적의 트레이드오프는 무엇인가?
  • RQ4VQ-VAE 기반 시스템은 ZeroSpeech 2019 공식 베이스라인 또는 톱라인 시스템보다 더 높은 이해 가능성과 자연스러움을 달성할 수 있는가?

주요 결과

  • 256개의 코드북과 4배 시간 감소를 적용한 VQ-VAE는 ABX 점수 23.59와 비트레이트 400을 기록하여 공식 베이스라인을 크게 능가하였다.
  • 제안된 시스템은 ABX 점수와 비트레이트 사이의 최적 균형을 달성하였으며, 256개 코드북과 4배 감소 모델이 제출용으로 선택되었다.
  • VQ-VAE 기반 코드북 표현은 ABX 및 비트레이트 지표에서 K-평균, GMM, 직접 특징 표현보다 열등한 성능을 보였다.
  • 다중 척도 Code2Spec 인버터는 고해상도 매그니튜드 스펙트로그램을 성공적으로 생성하여 이산 단위에서 고품질 음성 합성을 가능하게 하였다.
  • WaveNet 및 GAN 기반 음성 변환은 코드북에서 생성된 특징의 내재된 왜곡으로 인해 성능 향상을 이루지 못하였다.
  • 시스템은 객관적 평가(CER, ABX)와 주관적 평가(MOS) 모두에서 최신 기술 수준의 성능을 보였으며, 공식 베이스라인 및 톱라인 시스템을 모두 뛰어넘었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.