[논문 리뷰] NU-GAN: High resolution neural upsampling with GAN
NU-GAN은 주파수 도메인에서 크기 스펙트로그램에 대해 작동함으로써 위상 추정 과제를 피하면서 저해상도 오디오(22 kHz)를 고해상도 오디오(44.1 kHz)로 변환하는 GAN 기반 신경 업샘플링 방법을 제안한다. 원본 44.1 kHz 오디오와 거의 구분되지 않는 결과를 달성하며, ABX 테스트에서 단일 및 다중 화자 데이터셋에 대해 각각 무작위 선택보다 7.4%와 10.8% 높은 성능을 보였다.
In this paper, we propose NU-GAN, a new method for resampling audio from lower to higher sampling rates (upsampling). Audio upsampling is an important problem since productionizing generative speech technology requires operating at high sampling rates. Such applications use audio at a resolution of 44.1 kHz or 48 kHz, whereas current speech synthesis methods are equipped to handle a maximum of 24 kHz resolution. NU-GAN takes a leap towards solving audio upsampling as a separate component in the text-to-speech (TTS) pipeline by leveraging techniques for audio generation using GANs. ABX preference tests indicate that our NU-GAN resampler is capable of resampling 22 kHz to 44.1 kHz audio that is distinguishable from original audio only 7.4% higher than random chance for single speaker dataset, and 10.8% higher than chance for multi-speaker dataset.
연구 동기 및 목표
- 텍스트에서 음성으로 변환하는 시스템이 24 kHz까지 생성할 뿐이지만, 44.1 kHz 고해상도 오디오가 필요한 애플리케이션의 격차를 메우기 위해.
- 텍스트 및 화자 신원과 상관관계가 낮은 고주파 성분을 모델링하는 과제를 극복하기 위해.
- 기존 TTS 파이프라인의 원본 텍스트-스펙트로그램 또는 보크서 단계를 수정하지 않고도 통합할 수 있는 플러그인 모듈로 사용할 수 있는 빠르고 피드포워드 신경 업샘플러를 개발하기 위해.
- 이러한 맥락에서 이전에 달성되지 못한 44.1 kHz의 고품질 오디오 슈퍼레졸루션을 실현하기 위해.
- 원시 웨이브폼 생성 및 위상 복원의 복잡성을 피하는 계산적으로 효율적인 솔루션을 제공하기 위해.
제안 방법
- NU-GAN은 먼저 시간 도메인에서 sinc 보간을 적용하여 22 kHz 오디오를 44.1 kHz로 업샘플링한다.
- 그 후 보간된 신호에 대해 단기 푸리에 변환(STFT)을 수행하여 크기 스펙트로그램을 얻는다.
- 모델은 주파수 도메인에서 작동하며, 위상 정보를 유지하면서 부족한 고주파 성분의 크기 밴드를 예측하는 데 집중한다.
- 실제와 생성된 고해상도 스펙트로그램을 구분하는 디스크림너를 포함한 GAN 기반 아키텍처를 사용하여 실제적인 고주파 성분을 생성하도록 훈련한다.
- 모델은 완전히 피드포워드 구조이므로 자동적으로 순차적인 모델과 달리 빠른 추론과 병렬 샘플링이 가능하다.
- 정밀도와 자연스러움을 확보하기 위해 적대적 손실, 청각적 손실 및 재구성 손실을 조합한 훈련 목표를 사용한다.
실험 결과
연구 질문
- RQ1텍스트 및 화자 신원과 상관관계가 낮은 고주파 성분을 효과적으로 생성할 수 있는 GAN 기반 접근법이 가능한가?
- RQ2원시 웨이브폼 생성에 비해 크기 스펙트로그램의 주파수 도메인 모델링이 오디오 슈퍼레졸루션에서 더 효과적이고 효율적인가?
- RQ3신경 업샘플러가 원본 고해상도 레코딩과 청각적으로 구별되지 않는 44.1 kHz 오디오를 생성하도록 훈련시킬 수 있는가?
- RQ4단일 및 다중 화자 설정에서 NU-GAN의 성능이 기준선인 sinc 보간에 비해 청각적 품질 측면에서 어떻게 비교되는가?
- RQ5NU-GAN은 원본 텍스트-스펙트로그램 또는 보크서 구성 요소를 재학습하지 않고도 기존 TTS 파이프라인에 원활하게 통합될 수 있는가?
주요 결과
- 단일 화자 데이터셋에서 ABX 테스트를 통해 NU-GAN은 원본 44.1 kHz 오디오와의 청각적 구별 가능성을 랜덤 선택보다 단지 7.4% 높게 유지한다.
- 20명의 화자로 구성된 다중 화자 데이터셋에서 NU-GAN은 랜덤 선택보다 10.8% 높은 구별 가능성을 기록하며, 강력한 일반화 능력을 보였다.
- 단일 화자 데이터셋에서 기준선인 sinc 보간 대비 ABX 정확도가 약 20个百分点 높게 개선되었다.
- 모델은 완전히 피드포워드 구조이며 추론 속도가 매우 빨라 실시간 또는 거의 실시간 오디오 슈퍼레졸루션을 가능하게 한다.
- TTS 파이프라인에 대한 정성적 결과에서는 NU-GAN이 더 선명하고 자연스러운 음성, 특히 자음의 강화된 음소와 산소음 강도를 향상시킨 결과를 보였다.
- NU-GAN은 이전에 딥 생성 모델을 사용한 맥락에서 달성되지 못한 44.1 kHz에서 청각적으로 고품질의 오디오 슈퍼레졸루션을 달성한 최초의 방법이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.