Skip to main content
QUICK REVIEW

[논문 리뷰] High Fidelity Neural Audio Compression

Alexandre Défossez, Jade Copet|arXiv (Cornell University)|2022. 10. 24.
Speech and Audio Processing인용 수 279
한 줄 요약

EnCodec은 RVQ, 지각식 판별기, 선택적 Transformer 기반 엔트로피 코딩을 사용한 엔드투엔드 학습으로, 24 kHz 모노 및 48 kHz 스테레오에서 실시간 신호 대역에서 고충실도 압축을 달성하는 실시간 신경 오디오 코덱이다. 저비트레이트에서도 최첨단 MUSHRA 점수를 달성한다.

ABSTRACT

We introduce a state-of-the-art real-time, high-fidelity, audio codec leveraging neural networks. It consists in a streaming encoder-decoder architecture with quantized latent space trained in an end-to-end fashion. We simplify and speed-up the training by using a single multiscale spectrogram adversary that efficiently reduces artifacts and produce high-quality samples. We introduce a novel loss balancer mechanism to stabilize training: the weight of a loss now defines the fraction of the overall gradient it should represent, thus decoupling the choice of this hyper-parameter from the typical scale of the loss. Finally, we study how lightweight Transformer models can be used to further compress the obtained representation by up to 40%, while staying faster than real time. We provide a detailed description of the key design choices of the proposed model including: training objective, architectural changes and a study of various perceptual loss functions. We present an extensive subjective evaluation (MUSHRA tests) together with an ablation study for a range of bandwidths and audio domains, including speech, noisy-reverberant speech, and music. Our approach is superior to the baselines methods across all evaluated settings, considering both 24 kHz monophonic and 48 kHz stereophonic audio. Code and models are available at github.com/facebookresearch/encodec.

연구 동기 및 목표

  • 스트리밍 맥락에서 고충실도, 저비트레이트 신경 오디오 압축의 필요성에 대한 동기 부여.
  • 잔향 벡터 양자화와 지각 손실을 갖춘 엔드투엔드 스트리밍 코덱 제안으로 아티팩트를 최소화.
  • 이질적 손실을 안정적으로 훈련하기 위한 novel loss balancer 도입 및 경량 Transformer 기반 엔트로피 코딩의 영향 평가

제안 방법

  • 잠재 벡터 z를 생성하는 인코더-디코더 컨볼루션 아키텍처.
  • 다중 코드북을 갖는 인코더 출력의 RVQ.
  • 이산 RVQ 코드에 대한 엔트로피 코딩용 소형 Transformer 언어 모델.
  • 지각 손실을 위한 MS-STFT 기반 판별기.
  • 시간 영역 및 주파수 영역 재구성 손실, 적대적 손실 및 RVQ 커밋먼트 손실.
  • 훈련의 이질적 손실 간 균형을 맞춰 안정적으로 학습시키는 손실 균형자

실험 결과

연구 질문

  • RQ1실시간 스트리밍 신경 오디오 코덱이 음성 및 음악 도메인에서 저비트레이트로 고충실도 오디오를 제공할 수 있는가?
  • RQ224–48 kHz에서 최첨단 지각 품질을 달성하는 아키텍처 및 훈련 선택(RVQ, 판별기, 엔트로피 코딩)은 무엇인가?
  • RQ3그래디언트 균형자가 훈련 안정성과 손실 가중치 해석성에 어떤 영향을 미치는가?
  • RQ4주관적 품질(MUSHRA)이 허용되는 대역폭 및 샘플링 속도는 무엇인가?

주요 결과

  • EnCodec는 24 kHz 모노 및 48 kHz 스테레오에서 다중 비트레이트에서 최첨단 MUSHRA 점수를 달성한다(24 kHz에서 1.5–12 kbps; 48 kHz에서 6–24 kbps).
  • Transformer 기반 엔트로피 코딩은 특정 사용 사례에서 지각 저하 없이 대역폭을 20–40% 감소시킬 수 있다.
  • RVQ 및 스트리밍 친화적 패딩이 포함된 MS-STFT 기반 지각 손실은 고품질 샘플과 안정적 훈련을 제공한다.
  • 스트리밍(1패스, CPU 실시간) 인코딩/디코딩은 24 kHz에서 초기 지연 약 13 ms로 가능하고 6 kbps에서 실시간 처리가 가능하며 48 kHz에서 더 높은 지연.
  • 변형 연구에서 MS-STFT 판별기가 지각 품질에 충분하며 추가 MPD는 이득이 미미하다.
  • 스테레오 평가에서 EnCodec는 64 kbps의 MP3와 경쟁하고 6 kbps의 Opus보다 음악에 대해 우수하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.