Skip to main content
QUICK REVIEW

[논문 리뷰] SqueezeWave: Extremely Lightweight Vocoders for On-device Speech Synthesis

Bohan Zhai, Tianren Gao|arXiv (Cornell University)|2020. 01. 16.
Speech Recognition and Synthesis참고 문헌 16인용 수 21
한 줄 요약

SqueezeWave는 WaveGlow에서 유도된 초경량, 플로우 기반 보이스코더의 가족을 제안하며, 61배에서 214배 적은 MAC 연산을 통해 실시간으로 CPU 기반 장치(예: 맥북 및 라즈베리파이 3B+)에서 음성 합성 기능을 제공하면서도 파형 수준의 음질을 구현한다. 이는 계산 비용의 일부에 불과한 수준이다.

ABSTRACT

Automatic speech synthesis is a challenging task that is becoming increasingly important as edge devices begin to interact with users through speech. Typical text-to-speech pipelines include a vocoder, which translates intermediate audio representations into an audio waveform. Most existing vocoders are difficult to parallelize since each generated sample is conditioned on previous samples. WaveGlow is a flow-based feed-forward alternative to these auto-regressive models (Prenger et al., 2019). However, while WaveGlow can be easily parallelized, the model is too expensive for real-time speech synthesis on the edge. This paper presents SqueezeWave, a family of lightweight vocoders based on WaveGlow that can generate audio of similar quality to WaveGlow with 61x - 214x fewer MACs. Code, trained models, and generated audio are publicly available at https://github.com/tianrengao/SqueezeWave.

연구 동기 및 목표

  • 신경 보이스코더의 계산 비용을 극적으로 감소시켜 실시간, 온디바이스 텍스트 음성 합성을 가능하게 하기.
  • 플로우 기반 WaveGlow 아키텍처를 엣지 배포에 적합하도록 MAC 연산과 모델 파라미터를 최소화하여 적응시키기.
  • 모바일 및 임베디드 장치에서 모델 크기와 추론 지연을 줄이면서도 높은 음질을 유지하기.
  • 극도로 효율적인 계산 비용으로도 상태최근 수준에 가까운 음성 품질을 달성할 수 있음을 보여주기.

제안 방법

  • 효율적인 그룹화된 컨벌루션을 가능하게 하기 위해 오디오 텐서를 재정렬하여 계산 오버헤드를 감소시키기.
  • 표준 컨벌루션을 딥웨이즈 분리형 컨벌루션으로 대체하여 파라미터 수와 MAC 연산을 줄이기.
  • WaveGlow의 커파링 레이어에서 두 개의 병렬 브랜치를 하나의 경로로 통합하고 출력 채널 수를 절반으로 줄여 아키텍처를 단순화하기.
  • 잔여 스킵 연결을 최적화하여 출력 채널 수를 절반으로 줄여 계산 부담을 감소시키되 성능 손실 없이 유지하기.
  • WaveGlow는 8개의 V100 GPU를, SqueezeWave는 24개의 Titan RTX GPU를 사용하여 LJSpeech 데이터셋에서 SqueezeWave 모델를 처음부터 훈련하기.
  • 실시간 추론 속도를 측정하기 위해 맥북 프로 및 라즈베리파이 3B+와 같은 CPU 전용 장치에 모델을 배포하고 평가하기.

실험 결과

연구 질문

  • RQ1플로우 기반 보이스코더가 CPU 전용 엣지 장치에서 실시간 추론이 가능할 정도로 충분히 경량화될 수 있는가?
  • RQ2WaveGlow에 대한 아키텍처 수정이 음질을 유지하면서도 얼마나 많은 MAC 연산을 줄일 수 있는가?
  • RQ3저성능 하드웨어에서 SqueezeWave의 성능은 MOS, MAC, 추론 속도 측면에서 WaveGlow와 비교해 어떻게 되는가?
  • RQ4WaveGlow 대비 332배 적은 MAC을 사용하는 모델이 여전히 청취자에게 수용 가능한 음질을 제공할 수 있는가?

주요 결과

  • SqueezeWave 모델는 WaveGlow 대비 61배에서 214배 적은 MAC을 사용하며, 가장 큰 모델(SW-128L)은 22kHz 오디오당 3.78 GMACs의 연산량을 필요로 한다.
  • 맥북 프로에서 SqueezeWave는 123K~303K 샘플/초의 속도로 오디오를 생성하며, 실시간(22kHz) 대비 5.6배에서 13.8배 빠른 속도를 기록한다.
  • 라즈베리파이 3B+에서 SqueezeWave는 최대 21K 샘플/초의 속도를 기록했으며, SW-128S는 실시간에 가까운 성능(15.6K 샘플/초)을 달성했다.
  • 가장 큰 SqueezeWave 모델(SW-128L)은 MOS 4.07 ± 0.06을 기록했으며, WaveGlow의 4.57 ± 0.04와 유사한 높은 청취 품질을 보였다. 이는 복잡도가 감소했음에도 불구하고 높은 인지적 품질을 유지함을 시사한다.
  • 가장 작은 모델인 SW-64S는 오직 0.69 GMACs(332배 적은)를 사용하지만 MOS는 2.74 ± 0.04로 낮아, 효율성과 품질 사이의 상충 관계를 보여준다.
  • 라즈베리파이 3B+에서 WaveGlow는 실행되지 않았지만, 모든 SqueezeWave 버전은 성공적으로 작동하여 저자원 엣지 배포에 대한 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.