Skip to main content
QUICK REVIEW

[論文レビュー] Streamable Neural Audio Synthesis With Non-Causal Convolutions

Antoine Caillon, Philippe Esling|arXiv (Cornell University)|Apr 14, 2022
Music and Audio Processing被引用数 4
ひとこと要約

この論文では、非因果的畳み込みニューラルネットワークに内部遅延を導入することで、再訓練を必要とせず、高品質で低遅延なリアルタイム音声合成が可能な後処理手法を提案している。この手法により、RAVEなどの既存モデルを再訓練なしにリアルタイム対応に変換でき、オーバーモードアと比較して優れた速度を達成する。

ABSTRACT

Deep learning models are mostly used in an offline inference fashion. However, this strongly limits the use of these models inside audio generation setups, as most creative workflows are based on real-time digital signal processing. Although approaches based on recurrent networks can be naturally adapted to this buffer-based computation, the use of convolutions still poses some serious challenges. To tackle this issue, the use of causal streaming convolutions have been proposed. However, this requires specific complexified training and can impact the resulting audio quality. In this paper, we introduce a new method allowing to produce non-causal streaming models. This allows to make any convolutional model compatible with real-time buffer-based processing. As our method is based on a post-training reconfiguration of the model, we show that it is able to transform models trained without causal constraints into a streaming model. We show how our method can be adapted to fit complex architectures with parallel branches. To evaluate our method, we apply it on the recent RAVE model, which provides high-quality real-time audio synthesis. We test our approach on multiple music and speech datasets and show that it is faster than overlap-add methods, while having no impact on the generation quality. Finally, we introduce two open-source implementation of our work as Max/MSP and PureData externals, and as a VST audio plugin. This allows to endow traditional digital audio workstation with real-time neural audio synthesis on a laptop CPU.

研究の動機と目的

  • 元々ストリーミング用に設計されていなかった事前学習済み畳み込みモデルを用いて、リアルタイム神経音声合成を可能にすること。
  • 冗長な計算を導入せずに、非因果的畳み込みのバッファベース処理における位相不連続問題を克服すること。
  • デジタルオーディオワークステーションでの低遅延推論を実現しながら、音声品質とモデルの正確性を保持すること。
  • クリエイティブなオーディオワークフローにリアルタイム神経音声合成を統合できる実用的でオープンソースのツール(Max/MSP、PureData、VST)を提供すること。
  • 音楽や発話を含む多様なオーディオデータセットにおいて、最小限の遅延と高い速度で、この手法の有効性を示すこと。

提案手法

  • 推論後に内部遅延を導入することで、訓練済みの非因果的畳み込みモデルを因果的ストリーミング版に再構成し、元の計算グラフを保持すること。
  • キャッシュされた内部状態を用いて、音声バッファ境界を越えて時間的連続性を維持し、パディングの代わりに状態伝搬を実現すること。
  • 再訓練やモデルアーキテクチャの変更なしに、後処理段階でこの手法を適用すること。
  • すべての分岐にわたる遅延伝搬を慎重に管理することで、並列ブランチを有する複雑なアーキテクチャをサポートすること。
  • ライブラリとして実装し、Max/MSPおよびPureDataにはカスタムエクステンションを介して統合し、JUCEフレームワークを用いてVST3プラグインとして実装すること。
  • 最近傍補間による潜在表現の音声信号へのマッピングを提供し、グラフィカルインターフェースを通じて潜在次元のリアルタイム制御を可能にすること。

実験結果

リサーチクエスチョン

  • RQ1再訓練や音声品質の損失なしに、非因果的畳み込みモデルをストリーミング可能にすることができるか?
  • RQ2リアルタイムバッファベース処理を可能にしながら、モデルの正確性を維持するための内部遅延の導入方法は何か?
  • RQ3オーバーモードア手法と比較して、提案手法がどれほど遅延を低減し、推論速度を向上させるか?
  • RQ4並列ブランチを有する複雑なアーキテクチャや多様なオーディオ生成タスクへ一般化可能か?
  • RQ5リアルタイムユーザーインタラクションを伴う実際のクリエイティブなオーディオ環境(例:DAW)において、この手法はどれほど有効か?

主な発見

  • 提案手法は、元の非因果的モデルと同一の音声品質を維持しながら、オーバーモードア手法よりも高速な推論を達成している。
  • この手法により、標準のラップトップCPU上でオープンソースのMax/MSPおよびPureDataエクステンションを用いてリアルタイム音声合成が可能である。
  • VST3プラグイン実装では、ユーザーが各次元に対してスケーリング、バイアス、ノイズを定義可能な潜在表現のリアルタイム操作が可能である。
  • このアプローチにより、RAVEモデルが複数の音楽および発話データセットで音声品質に劣化を来さずにストリーミング可能に変換された。
  • 慎重な遅延管理により、並列ブランチを有する複雑なアーキテクチャに対してもこの手法は適合可能である。
  • オープンソースのライブラリおよびプラグインにより、従来のデジタルオーディオワークステーションへの神経音声合成のシームレスな統合が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。