Skip to main content
QUICK REVIEW

[논문 리뷰] From Discrete Tokens to High-Fidelity Audio Using Multi-Band Diffusion

Robin San Roman, Yossi Adi|arXiv (Cornell University)|2023. 08. 02.
Music and Audio ProcessingComputer Science인용 수 3
한 줄 요약

이 논문은 주파수 대역별로 독립적으로 처리하는 주파수 대역 특화 확산 모델과 주파수 등화기 및 새로운 파wr 노이즈 스케줄러를 갖춘 고음질 음성 생성 프레임워크인 Multi-Band Diffusion(MBD)을 제안한다. 이는 저비트레이트 이산 음성 토큰에서 자연스러운 말, 음악 및 환경 음향을 생성한다. 이 방법은 객관적 지표와 인간 평가 모두에서 최신 기술보다 뛰어나며, 6 kbps에서 뛰어난 청취 품질을 달성한다.

ABSTRACT

Deep generative models can generate high-fidelity audio conditioned on various types of representations (e.g., mel-spectrograms, Mel-frequency Cepstral Coefficients (MFCC)). Recently, such models have been used to synthesize audio waveforms conditioned on highly compressed representations. Although such methods produce impressive results, they are prone to generate audible artifacts when the conditioning is flawed or imperfect. An alternative modeling approach is to use diffusion models. However, these have mainly been used as speech vocoders (i.e., conditioned on mel-spectrograms) or generating relatively low sampling rate signals. In this work, we propose a high-fidelity multi-band diffusion-based framework that generates any type of audio modality (e.g., speech, music, environmental sounds) from low-bitrate discrete representations. At equal bit rate, the proposed approach outperforms state-of-the-art generative techniques in terms of perceptual quality. Training and, evaluation code, along with audio samples, are available on the facebookresearch/audiocraft Github page.

연구 동기 및 목표

  • 이슬립된 조건 조건에서 저비트레이트 이산 표현으로부터 청취 가능한 잡음이 발생하는 문제를 해결하기 위해.
  • GAN 기반 복원기 대신 확산 기반 접근법을 도입하여 음성 합성의 청취 품질을 향상시키고 잡음을 줄이기 위해.
  • 압축된 이산 토큰 시퀀스에서 고음질, 일반적인 목적의 음성 생성(말, 음악, 환경 음향 포함)을 가능하게 하기 위해.
  • 다양한 음성 영역과 저비트레이트에서 품질을 유지하는 확산 프레임워크의 확장성과 강건성을 확보하기 위해.
  • 확산 모델이 종래의 GAN 기반 디코더를 종단 간 음성 압축 및 생성 파이프라인에서 효과적으로 대체할 수 있음을 보여주기 위해.

제안 방법

  • 모델은 비중첩 주파수 대역을 개별적으로 처리하는 다중 대역 확산 아키텍처를 사용하여 오차 누적을 줄이고 각 대역에 대해 타겟된 노이즈 제거를 가능하게 한다.
  • 주파수 등화기(EQ) 프로세서는 대역 간 에너지 분포를 정규화하여 데이터 분포를 사전 가우시안과 일치시켜 훈련 안정성과 샘플 품질을 향상시킨다.
  • 풍부한 고조파 성분을 지닌 음성 신호를 더 잘 다루기 위해 새로운 파워 노이즈 스케줄러를 도입하여 고주파 영역에서의 노이즈 제거 과정을 향상시켰다.
  • 압축 모델(예: EnCodec)에서 유도된 이산 토큰 시퀀스를 엔드 투 엔드로 훈련하며, 각 대역은 해당 잠재 표현에 조건화된다.
  • 학습된 이산 코드에 조건화하여 다양한 음성 모odalities(예: 말, 음악, 환경 음향)에 대해 제로샷 적응을 지원한다.
  • 기존의 시퀀스 모델링 파이프라인(예: Bark, MusicGen 등 음성 토큰에 언어 모델을 사용하는 것)과 호환되어 디코더를 즉각 교체할 수 있다.

실험 결과

연구 질문

  • RQ1확산 기반 모델이 저비트레이트 이산 표현에서 고음질 음성을 생성하는 데서 GAN 기반 복원기보다 뛰어나게 성능을 내는가?
  • RQ2다중 대역 확산 아키텍처는 전체 대역 확산 또는 단일 대역 접근 방식보다 오차 전파를 줄이고 샘플 품질을 향상시키는가?
  • RQ3주파수 등화기와 파워 노이즈 스케줄러가 생성된 음성의 품질과 청취 품질을 어느 정도 향상시키는가?
  • RQ4이중 이산 토큰에 조건화되었을 때, 제안된 방법이 말, 음악, 환경 음향과 같은 다양한 음성 영역으로 일반화되는가?
  • RQ5저비트레이트(예: 6 kbps)에서 인간 평가 및 객관적 지표를 기준으로 MBD 모델의 청취 품질이 최신 기술 기준보다 어떻게 뛰어나게 되는가?

주요 결과

  • 6 kbps에서 MBD 모델은 ViSQOL 점수 3.67 ± 0.02를 기록하며, 기준 EnCodec(64.34 MUSHRA) 및 기타 기준 모델보다 유의미하게 뛰어나다.
  • 인간 평가 결과, MBD는 말에 대해 평균 +11.76점, 음악에 대해 +4.0점의 MUSHRA 점수 향상을 기록하며 EnCodec 기준보다 향상되었다.
  • 6 kbps에서 MBD 모델은 Mel-SNR-M 점수 9.85를 기록하여, 프로세서가 없는 변형(Variant, 9.68)과 선형 스케줄러(7.10)보다 뛰어나, 전체 파이프라인의 효과성을 입증했다.
  • 주파수 등화기와 파워 노이즈 스케줄러는 핵심 구성 요소이다: EQ 프로세서를 제거하면 ViSQOL 점수가 0.29점 감소하고, 선형 스케줄러를 사용할 경우 성능이 크게 떨어진다.
  • 텍스트-음성 및 텍스트-음악 생성에서 MBD는 전통적인 GAN 기반 디코더보다 청취 가능한 잡음(특히 금속성 또는 왜곡된 소리)을 줄였다.
  • 객관적 지표(ViSQOL, Mel-SNR)와 주관적 인간 평가 양면에서 최신 기술 수준의 성능을 달성하여, 청취 품질과 분포 내 생성 측면에서의 우수성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.