Skip to main content
QUICK REVIEW

[論文レビュー] From Discrete Tokens to High-Fidelity Audio Using Multi-Band Diffusion

Robin San Roman, Yossi Adi|arXiv (Cornell University)|Aug 2, 2023
Music and Audio ProcessingComputer Science被引用数 3
ひとこと要約

本論文では、周波数帯域別拡散モデルに周波数イコライザと新規のパワー・ノイズスケジューラを組み合わせた高精細音声生成フレームワーク、Multi-Band Diffusion (MBD) を提案する。この手法は、低ビットレートの離散的音声トークンから自然な話し声、音楽、環境音を合成可能であり、6 kbpsで優れた聴覚的品質を達成する。GANおよび拡散モデルベースの最先端手法と比較して、客観的指標および人間評価の両面で顕著に優れている。

ABSTRACT

Deep generative models can generate high-fidelity audio conditioned on various types of representations (e.g., mel-spectrograms, Mel-frequency Cepstral Coefficients (MFCC)). Recently, such models have been used to synthesize audio waveforms conditioned on highly compressed representations. Although such methods produce impressive results, they are prone to generate audible artifacts when the conditioning is flawed or imperfect. An alternative modeling approach is to use diffusion models. However, these have mainly been used as speech vocoders (i.e., conditioned on mel-spectrograms) or generating relatively low sampling rate signals. In this work, we propose a high-fidelity multi-band diffusion-based framework that generates any type of audio modality (e.g., speech, music, environmental sounds) from low-bitrate discrete representations. At equal bit rate, the proposed approach outperforms state-of-the-art generative techniques in terms of perceptual quality. Training and, evaluation code, along with audio samples, are available on the facebookresearch/audiocraft Github page.

研究の動機と目的

  • 離散表現からの低ビットレート音声生成における聴覚的に明白なアーティファクトの問題、特に条件付けが不完全な場合を解決すること。
  • GANベースのボコーダーを拡散モデルベースのアプローチに置き換えることで、音声合成の知覚的品質を向上させ、アーティファクトを低減すること。
  • 圧縮された離散的トークン列から、話し声、音楽、環境音を含む高精細で汎用的な音声生成を可能にすること。
  • 多様な音声ドメインおよび低ビットレート環境においても忠実度を維持できるスケーラブルで頑健な拡散フレームワークを開発すること。
  • 拡散モデルがエンドツーエンドの音声圧縮および生成パイプラインにおける従来のGANベースのデコーダーを効果的に置き換えられることを示すこと。

提案手法

  • 非重複周波数帯域を個別に処理するマルチバンド拡散アーキテクチャを採用し、誤差の蓄積を低減するとともに、各帯域ごとの的確なノイズ除去を可能にする。
  • 周波数イコライザ(EQ)プロセッサにより、帯域間のエネルギー分布を正規化し、データ分布を事前分布のガウス分布に合わせることで、学習の安定性とサンプル品質を向上させる。
  • 豊富な高調波成分を有する音声信号に対応するため、新規のパワー・ノイズスケジューラを導入し、高周波帯域におけるノイズ除去プロセスを改善する。
  • 圧縮モデル(例:EnCodec)から得られる離散的トークン列に対して、エンドツーエンドで学習を行い、各帯域をその対応する潜在表現で条件づける。
  • 学習済みの離散コードを条件として用いることで、話し声、音楽、環境音など多様な音声モodal にゼロショット適応が可能である。
  • 言語モデルを音声トークンに適用するパイプライン(例:Bark、MusicGen)と互換性があり、デコーダーの即時交換が可能である。

実験結果

リサーチクエスチョン

  • RQ1拡散モデルベースのアプローチは、低ビットレートの離散的表現からの高精細音声生成において、GANベースのボコーダーを上回ることができるか?
  • RQ2マルチバンド拡散アーキテクチャは、フルバンド拡散やシングルバンド手法と比較して、誤差伝搬を低減し、サンプル品質を向上させることができるか?
  • RQ3周波数イコライザおよびパワー・ノイズスケジューラは、生成音声の忠実度および知覚的品質をどの程度向上させるか?
  • RQ4離散的トークンを条件として用いる場合、話し声、音楽、環境音など多様な音声ドメインに一般化可能か?
  • RQ56 kbpsなどの低ビットレートにおいて、人間評価および客観的指標の両面で、Multi-Band Diffusionモデルの知覚的品質は最先端のベースラインと比べてどの程度優れているか?

主な発見

  • 6 kbpsで、MBDモデルはViSQOLスコア3.67 ± 0.02を達成し、ベースラインのEnCodec(64.34 MUSHRA)および他のベースラインを顕著に上回った。
  • 人間評価では、MBDは話し声において平均+11.76ポイント、音楽において+4.0ポイントのMUSHRAスコア向上を達成し、EnCodecベースラインを上回った。
  • 6 kbpsでMBDモデルはMel-SNR-Mスコア9.85を達成し、プロセッサなしバージョン(9.68)および線形スケジューラ(7.10)を上回り、パイプライン全体の有効性を示した。
  • 周波数イコライザおよびパワー・ノイズスケジューラは重要な構成要素である:EQプロセッサを除去するとViSQOLが0.29ポイント低下し、線形スケジューラを用いるとも顕著な性能低下を示した。
  • テキストから音声および音楽を生成するタスクにおいて、MBDは金属的または歪んだ音を示す聴覚的アーティファクトを、標準のGANベースのデコーダーと比較して低減した。
  • 客観的指標(ViSQOL、Mel-SNR)および主観的人間評価の両面で、本手法は最先端の性能を達成し、知覚的品質および分布内生成の優位性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。