[논문 리뷰] LightSpeech: Lightweight and Fast Text to Speech with Neural Architecture Search
LightSpeech는 FastSpeech 2 기반으로 경량이고 빠른 텍스트-to-음성 모델을 자동으로 설계하기 위해 신경망 아키텍처 탐색(NAS) 기반 접근법을 제안한다. 모델 구성 요소를 프로파일링하고, 깊이 분리형 컨볼루션 및 효율적인 블록을 고려한 타깃 설정된 검색 공간을 설계함으로써, 15배 모델 압축, 16배 적은 MACs, CPU에서 6.5배 빠른 추론을 달성하면서도 음성 품질은 유사 수준을 유지한다.
Text to speech (TTS) has been broadly used to synthesize natural and intelligible speech in different scenarios. Deploying TTS in various end devices such as mobile phones or embedded devices requires extremely small memory usage and inference latency. While non-autoregressive TTS models such as FastSpeech have achieved significantly faster inference speed than autoregressive models, their model size and inference latency are still large for the deployment in resource constrained devices. In this paper, we propose LightSpeech, which leverages neural architecture search~(NAS) to automatically design more lightweight and efficient models based on FastSpeech. We first profile the components of current FastSpeech model and carefully design a novel search space containing various lightweight and potentially effective architectures. Then NAS is utilized to automatically discover well performing architectures within the search space. Experiments show that the model discovered by our method achieves 15x model compression ratio and 6.5x inference speedup on CPU with on par voice quality. Audio demos are provided at https://speechresearch.github.io/lightspeech.
연구 동기 및 목표
- 모바일폰과 임베디드 시스템과 같은 자원 제약이 있는 장치에 고품질 TTS 모델을 구현하는 데 도전하는 것.
- 음성 품질을 훼손하지 않고도 모델 크기, 추론 지연 시간, 계산 비용(MACs)을 줄이는 것.
- 일반적으로 성능 저하를 초래하는 수동적 모델 압축의 한계를 극복하는 것.
- 특히 FastSpeech 2와 같은 비자기적 아키텍처를 위한 순차적-순차적 TTS 모델에 특화된 검색 공간과 NAS 파이프라인 개발.
- NAS가 TTS 작업에서 인간이 설계한 경량 모델보다 효율성과 성능 면에서 뛰어나다는 것을 입증하는 것.
제안 방법
- 메모리 및 지연 시간 병목 현상을 특정하기 위해 FastSpeech 2 구성 요소를 세밀하게 프로파일링하였으며, 특히 인코더, 디코더 및 변동 예측기에서 주로 발생함을 확인.
- 깊이 분리형 컨볼루션(SepConv), 가변 커널 크기, 감소된 블록 수를 포함하는 새로운 검색 공간을 설계하였으며, 모델 용량은 유지함.
- 체인 구조의 검색 공간과 호환되며 효율성이 높은 GBDT-NAS를 검색 알고리즘으로 선택.
- 기울기 부스팅 결정수 나무를 통한 정확도 예측을 사용하여 전체 훈련 없이도 후보 아키텍처를 효율적으로 평가.
- SepConv를 포함한 경량이고 효과적인 구성 요소들만 포함하도록 검색 공간을 최적화하였으며, 커널 크기는 5, 9, 13, 17, 21, 25로 설정.
- 표준 TTS 평가 지표인 멜스펙트로그램 손실 및 음성 품질을 평가하기 위한 CMOS를 사용해 최종 아키텍처를 훈련 및 평가함.
실험 결과
연구 질문
- RQ1신경망 아키텍처 탐색이 효율성과 품질 면에서 수동으로 설계된 모델보다 뛰어난 경량 TTS 아키텍처를 효과적으로 발견할 수 있는가?
- RQ2검색 공간 설계의 선택이 TTS 모델에서 NAS의 성능과 효율성에 어떤 영향을 미치는가?
- RQ3깊이 분리형 컨볼루션과 아키텍처 프루닝을 통해 얼마나 모델 크기와 MACs를 줄일 수 있으며, 음성 품질 저하 없이 가능한가?
- RQ4NAS 기반 압축이 표준 FastSpeech 2와 비교해 CPU에서 상당한 속도 향상을 이룰 수 있는가?
- RQ5NAS로 발견된 모델의 성능은 수동으로 설계된 FastSpeech 2의 경량 변종과 비교해 추론 지연 시간과 모델 크기 측면에서 어떻게 다른가?
주요 결과
- NAS로 발견된 LightSpeech 모델은 15배의 모델 압축 비율(1.8M 파라미터 대 FastSpeech 2의 27M 파라미터)을 달성함.
- LightSpeech는 계산 비용을 16배 줄였으며, FastSpeech 2의 12.50G MACs 대비 0.76G MACs로 감소.
- CPU에서 추론 시간이 6.5배 빨라졌으며, RTF는 6.1×10⁻²에서 9.3×10⁻³으로 감소.
- LightSpeech는 동등한 음성 품질을 유지하였으며, CMOS 점수는 FastSpeech 2의 0.2575와 유사한 0.2561을 기록.
- 검색 공간에서 무작위 샘플링조차도 수동으로 설계된 경량 FastSpeech 2*(0.2753 대 0.2956 손실)를 초월함으로써 검색 공간의 품질을 입증.
- 최종 아키텍처는 인코더에서 커널 크기 5, 25, 13, 9, 디코더에서 17, 21, 9, 13인 SepConv 레이어의 시퀀스로 구성되며, 모두 은닉 크기 256을 사용함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.