[論文レビュー] Speech Enhancement and Dereverberation with Diffusion-based Generative Models
本稿では、ノイジーな音声に加えてノイズを条件として用いることで、30ステップで高品質なクリア音声を生成可能な、音声強調およびドレバーバレーションのための拡散ベース生成モデルを提案する。この手法は、模擬的および実世界のデータの両方で最先端の性能を達成し、一般化性能および聴取品質の面で判別モデルを上回り、加法的ノイズ除去を超えてドレバーバレーションへの応用にも効果的に拡張可能である。
In this work, we build upon our previous publication and use diffusion-based generative models for speech enhancement. We present a detailed overview of the diffusion process that is based on a stochastic differential equation and delve into an extensive theoretical examination of its implications. Opposed to usual conditional generation tasks, we do not start the reverse process from pure Gaussian noise but from a mixture of noisy speech and Gaussian noise. This matches our forward process which moves from clean speech to noisy speech by including a drift term. We show that this procedure enables using only 30 diffusion steps to generate high-quality clean speech estimates. By adapting the network architecture, we are able to significantly improve the speech enhancement performance, indicating that the network, rather than the formalism, was the main limitation of our original approach. In an extensive cross-dataset evaluation, we show that the improved method can compete with recent discriminative models and achieves better generalization when evaluating on a different corpus than used for training. We complement the results with an instrumental evaluation using real-world noisy recordings and a listening experiment, in which our proposed method is rated best. Examining different sampler configurations for solving the reverse process allows us to balance the performance and computational speed of the proposed method. Moreover, we show that the proposed method is also suitable for dereverberation and thus not limited to additive background noise removal. Code and audio examples are available online, see https://github.com/sp-uhh/sgmse.
研究の動機と目的
- 判別モデルを超える音声強調を実現する生成モデルを開発し、クリア音声の事前分布を学習すること。
- 従来の拡散モデルが純粋なノイズから出発するという制限を克服し、ノイジー音声に加えてノイズを条件として逆拡散プロセスを条件づけること。
- 特に実世界のノイズ音声に対して、訓練とテストの不一致状況下でも一般化性能を向上させること。
- 加法的ノイズ除去を超えて、音声ドレバーバレーションへの応用も可能であることを示し、フレームワークの汎用性を拡張すること。
- 実世界データを用いたインstrumental指標および聴取テストを用いて、手法の評価を行うこと。
提案手法
- クリア音声の複素数短時間フーリエ変換(STFT)表現を用いたスコアマッチングによるスコアベース生成モデルを訓練する。
- 劣化をモデル化するドリフト項を備えた、徐々にノイズとリバーブを加える前向きプロセスとして確率的微分方程式(SDE)を採用する。
- 純粋なノイズではなく、ノイジー音声とガウスノイズの混合物を条件として逆プロセスを条件づけることで、前向きプロセスと整合性をとる。
- 残差ブロックとアテンション機構を備えたU-Netアーキテクチャを適応させ、モデルの表現力と性能を向上させる。
- 訓練の安定化のため、分散が爆発する(VE)SDE定式化を用いたノイズ除去スコアマッチング目的関数を採用する。
- Euler–Maruyamaなどの数値ソルバを用いた反復的サンプリングにより、ノイジー入力からクリア音声推定値を生成する。
実験結果
リサーチクエスチョン
- RQ1ノイジー音声を条件として用いる拡散ベース生成モデルは、一致・不一致の両条件下で、判別モデルを上回る性能を示せるか?
- RQ2ノイジー音声に加えてノイズを条件として逆拡散プロセスを条件づけることで、サンプル品質が向上し、必要なステップ数が削減されるか?
- RQ3同じフレームワークを、加法的ノイズ除去を超えてドレバーバレーションにも効果的に適用できるか?
- RQ4クリア参照が存在しない実世界の非模擬的ノイズ音声に対して、本手法はどの程度の性能を示すか?
- RQ5逆プロセスにおける関数評価回数(NFE)を変化させた際の、サンプリング速度と音声品質のトレードオフは何か?
主な発見
- 実世界のノイズ音声(DNS Challenge 2020テストセット)において、本手法はDNSMOSスコア3.64を達成し、すべてのベースライン(MetricGAN+ や Conv-TasNet を含む)を上回った。
- 訓練をVB-DMD、テストをDNSで行う不一致条件では、本手法が最高のSDR(13.4 dB)とESTOI(0.82)を達成し、すべての判別モデルおよび生成モデルベースラインを上回った。
- 高品質な出力を維持しながら、拡散ステップ数を30にまで削減した。GPU上でのリアルタイム要因(RTF)は0.12であった。
- MC-WSJ-AVデータセットでは、ドレバーバレーションにおいてPESQが3.21、SDRが11.8 dBを達成し、判別モデルベースラインを著しく上回った。
- 聴取実験では、人間被験者による平均評価スコア(MOS)が5点中4.25と最高評価を得た。
- 本手法は実世界のノイズに対して頑健であり、混合音声よりも非侵襲的指標(SIG:3.42、BAK:3.82)が向上した。一方、判別モデルはSIGで劣化を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。