Skip to main content
QUICK REVIEW

[論文レビュー] High Fidelity Neural Audio Compression

Alexandre Défossez, Jade Copet|arXiv (Cornell University)|Oct 24, 2022
Speech and Audio Processing被引用数 279
ひとこと要約

EnCodecはリアルタイムのニューラル音声コーデックで、RVQ、感覚識別子、任意のTransformerベースのエントロピー符号化を用いたエンドツーエンド訓練により、24 kHzモノラルと48 kHzステレオで高忠実度圧縮を実現し、低ビットレートで最先端のMUSHRAスコアを達成します。

ABSTRACT

We introduce a state-of-the-art real-time, high-fidelity, audio codec leveraging neural networks. It consists in a streaming encoder-decoder architecture with quantized latent space trained in an end-to-end fashion. We simplify and speed-up the training by using a single multiscale spectrogram adversary that efficiently reduces artifacts and produce high-quality samples. We introduce a novel loss balancer mechanism to stabilize training: the weight of a loss now defines the fraction of the overall gradient it should represent, thus decoupling the choice of this hyper-parameter from the typical scale of the loss. Finally, we study how lightweight Transformer models can be used to further compress the obtained representation by up to 40%, while staying faster than real time. We provide a detailed description of the key design choices of the proposed model including: training objective, architectural changes and a study of various perceptual loss functions. We present an extensive subjective evaluation (MUSHRA tests) together with an ablation study for a range of bandwidths and audio domains, including speech, noisy-reverberant speech, and music. Our approach is superior to the baselines methods across all evaluated settings, considering both 24 kHz monophonic and 48 kHz stereophonic audio. Code and models are available at github.com/facebookresearch/encodec.

研究の動機と目的

  • ストリーミング文脈で高忠実度・低ビットレートのニューラル音声圧縮が求められる理由を動機づける。
  • アーティファクトを最小化する残差ベクトル量子化と知覚的損失を用いたエンドツーエンドのストリーミングコーデックを提案する。
  • 新規のロスバランサーで訓練を安定化させ、軽量なTransformerベースのエントロピー符号化の影響を評価する。

提案手法

  • エンコーダ-デコーダ畳み込みアーキテクチャが潜在表現zを生成する。
  • エンコーダ出力のRVQを複数のコードブックで実現。
  • 離散的なRVQコード上のエントロピー符号化のための小型Transformer言語モデル。
  • 感覚的損失のためのMS-STFTベースのマルチスケール識別子(MS-STFT)。
  • 時系列と周波数領域の再構成損失および敵対的損失とRVQコミットメント損失。
  • 訓練を安定化させるための異種損失間で勾配をスケールするロスバランサー。

実験結果

リサーチクエスチョン

  • RQ1ストリーミングニューラル音声コーデックは、音声と音楽領域を横断して、リアルタイムで高忠実度・低ビットレートの音声を提供できるか?
  • RQ2どのアーキテクチャおよび訓練選択(RVQ、識別子、エントロピー符号化)が24–48 kHzで最先端の知覚品質を生み出すか?
  • RQ3勾配バランサーは訓練の安定性とロス重みの解釈性にどのような影響を与えるか?
  • RQ4受け入れ可能な主観品質(MUSHRA)でサポートできる帯域幅とサンプリング周波数は何か?

主な発見

  • EnCodecは24 kHzモノラルおよび48 kHzステレオで複数のビットレート(24 kHz時の1.5–12 kbps、48 kHz時の6–24 kbps)で最先端のMUSHRAスコアを達成する。
  • Transformerベースのエントロピー符号化は特定のユースケースで知覚劣化なしに帯域幅を20–40%削減できる。
  • RVQとストリーミング対応パディングを伴うMS-STFTベースの知覚損失が高品質サンプルと安定した訓練を実現。
  • ストリーミング(1-pass、CPUリアルタイム)エンコード/デコードは24 kHzで約13 msの初期待ち時間と6 kbpsでリアルタイム処理を実現可能だが、48 kHzでは遅延が大きくなる。
  • アブレーションによりMS-STFT識別子が知覚品質に十分であり、追加のMPDは限界的な利得しかもたらさない。
  • ステレオ評価ではEnCodecが64 kbpsのMP3に対して競合し、6 kbpsのOpusより音楽で優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。