Skip to main content
QUICK REVIEW

[論文レビュー] Neural Waveshaping Synthesis

Ben J. Hayes, Charalampos Saitis|arXiv (Cornell University)|Jul 11, 2021
Music and Audio Processing被引用数 10
ひとこと要約

本稿では、周期的活性化関数を用いた時系列分散型多層パーセプトロンにより、連続的で微分可能な波形整形関数を学習する、軽量で完全に因果的なニューラル音声合成モデルであるニューラルウェーブシェーピングユニット(NEWT)を紹介する。NEWTは260kパラメータで構成され、コンsumer CPU上でリアルタイム性能(RTF < 1)を達成しており、DDSP や HTP などの既存の最先端手法と比較して、速度面で優れており、聴取テストおよび Fréchet Audio Distance(FAD)指標においても競争力のある音質を維持している。

ABSTRACT

We present the Neural Waveshaping Unit (NEWT): a novel, lightweight, fully causal approach to neural audio synthesis which operates directly in the waveform domain, with an accompanying optimisation (FastNEWT) for efficient CPU inference. The NEWT uses time-distributed multilayer perceptrons with periodic activations to implicitly learn nonlinear transfer functions that encode the characteristics of a target timbre. Once trained, a NEWT can produce complex timbral evolutions by simple affine transformations of its input and output signals. We paired the NEWT with a differentiable noise synthesiser and reverb and found it capable of generating realistic musical instrument performances with only 260k total model parameters, conditioned on F0 and loudness features. We compared our method to state-of-the-art benchmarks with a multi-stimulus listening test and the Fréchet Audio Distance and found it performed competitively across the tested timbral domains. Our method significantly outperformed the benchmarks in terms of generation speed, and achieved real-time performance on a consumer CPU, both with and without FastNEWT, suggesting it is a viable basis for future creative sound design tools.

研究の動機と目的

  • DAWワークフローと互換性を持つリアルタイムで軽量なニューラル音声合成モデルの不足を補う。
  • ニューラルウェーブシェーピングを用いて、波形ドメインで効率的で因果的かつ解釈可能な音声合成を実現する。
  • DDSP や HTP などの既存の最先端手法と比較して、モデルサイズと推論遅延を低減する。
  • 学習されたウェーブシェーピング関数のアフィン変換を用いて、動的なトーンの進化を可能にする。
  • CPU効率の良い推論により、リアルタイム音楽制作環境へのシームレスな統合を実現する。

提案手法

  • NEWTは、周期的活性化関数を用いた時系列分散型多層パーセプトロンを用い、トーン合成のための非線形ウェーブシェーピング伝達関数を暗黙的に学習する。
  • モデルは学習済みウェーブシェーパーをハーモニックエキサイタ信号に適用し、制御信号(F0 とラウドネス)がアフィン変換により入力および出力のスケーリングとシフトを制御する。
  • 微分可能なノイズシンセサイザーとリバーブを統合し、生成音声の現実性を向上させる。
  • FastNEWTは、プルーニングと量子化に基づく最適化手法であり、CPU推論の効率を向上させる。これは、最良のベンチマークと比較して推論時間を 2.9倍短縮した。
  • アーキテクチャは、波形再構成損失と知覚的損失の組み合わせを用いて訓練され、すべてのコンponentsがエンドツーエンド微分可能である。
  • モデルの評価には、マルチステイミュラス聴取テストおよび Fréchet Audio Distance(FAD)が用いられ、推論効率の測定にはリアルタイム係数(RTF)が使用された。

実験結果

リサーチクエスチョン

  • RQ1軽量で完全に因果的なニューラルアーキテクチャは、現実的な楽器トーン合成のための効果的なウェーブシェーピング関数を学習できるか?
  • RQ2260kパラメータという小さなモデルは、より大きな最先端モデルと比較して、競争力のある音質を達成できるか?
  • RQ3音質を犠牲にせずに、コンsumer CPU上でリアルタイム性能を達成できるか?
  • RQ4学習されたウェーブシェーピング関数は、トーンの進化と音質にどのように寄与するか?
  • RQ5制御信号を用いて、トーン転送やマルチインストゥルメント合成への一般化が可能か?

主な発見

  • NEWTモデルは、コンsumer CPU(Intel i5 1038NG7)上で4秒入力に対して平均RTF 0.96を達成し、すべてのベンチマークを上回るリアルタイム性能を示した。
  • FastNEWTは、CPU上で最良のベンチマークと比較して平均RTFを2.9倍改善し、推論効率を顕著に向上させた。
  • マルチステイミュラス聴取テストにおいて、特にトランペットとクラリネットのトーンで、最先端手法と同等の性能を示した。
  • Fréchet Audio Distance(FAD)スコアは、バイオリントーンでは同サイズのDDSPベンチマークと同等であり、他のトーンではそれを上回った。
  • 最先端モデルと比較して20倍のパラメータ削減を達成しながらも、高い音質とリアルタイム性能を維持した。
  • 可視化結果から、NEWTがエキサイタ信号に対して実際にウェーブシェーピングを実行していることが確認され、学習済みの整形関数とアフィンパラメータが動的にトーンを制御していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。