Skip to main content
QUICK REVIEW

[論文レビュー] SignalTrain: Profiling Audio Compressors with Deep Neural Networks

Scott H. Hawley, Benjamin Colburn|arXiv (Cornell University)|May 28, 2019
Music and Audio Processing被引用数 8
ひとこと要約

本稿では、制御パrameterを条件として、生の音声入力を出力にマッピングするエンド・ツー・エンドの学習を可能にする、深層自己符号化モデルSignalTrainを提案する。この手法は、ソフトウェアおよびアナログ・コンプレッサーの主な機能的・聴覚的特性を的確に捉えているが、残存ノイズのため、即時の実用的導入には制限がある。

ABSTRACT

In this work we present a data-driven approach for predicting the behavior of (i.e., profiling) a given non-linear audio signal processing effect (henceforth "audio effect"). Our objective is to learn a mapping function that maps the unprocessed audio to the processed by the audio effect to be profiled, using time-domain samples. To that aim, we employ a deep auto-encoder model that is conditioned on both time-domain samples and the control parameters of the target audio effect. As a test-case study, we focus on the offline profiling of two dynamic range compression audio effects, one software-based and the other analog. Compressors were chosen because they are a widely used and important set of effects and because their parameterized nonlinear time-dependent nature makes them a challenging problem for a system aiming to profile "general" audio effects. Results from our experimental procedure show that the primary functional and auditory characteristics of the compressors can be captured, however there is still sufficient audible noise to merit further investigation before such methods are applied to real-world audio processing workflows.

研究の動機と目的

  • ドメイン特化の信号モデルに依存しない、データ駆動型でエンド・ツー・エンドの深層学習的手法を用いて一般音響エフェクトのプロファイリングを開発すること。
  • 従来の手法が失敗する非線形的かつ時間依存的な音響エフェクト(特にダイナミックレンジコンプレッサー)をモデル化する課題に取り組むこと。
  • 単一のニューラルネットワークが、入力-出力音声ペアのみを用いて、実世界のコンプレッサーの複雑でパrameter化された挙動を学習・再現できるかどうかを評価すること。
  • 生の時間領域波形と制御パrameterを入力として用いるモデルの訓練が、異なるコンプレッサー設定に一般化できるかどうかを評価すること。
  • 現在の深層学習手法における音響エフェクトモデリングの限界、特に残存ノイズと計算コストを特定すること。

提案手法

  • ボトルネック層を備えた深層自己符号化器アーキテクチャを用い、入力音声の圧縮表現を学習する。
  • 目的とするコンプレッサーの制御パrameter(例:ピークリダクションノブ、コンプレス/リミットスイッチ)と、生の時間領域音声サンプルの両方で条件付けられる。
  • 時間的依存性をモデル化するため、可変的なルックバックサイズを有する音声フレームのシーケンスを入力とし、因果的処理を模倣する。
  • 特徴正則化と学習安定性の向上のため、自己符号化器内にスペクトル表現を用いる。
  • 予測波形とターゲット波形の間の平均二乗誤差損失を用いて勾配降下法で訓練する。
  • 訓練効率と収束性を最適化するため、1サイクル学習率ポリシーを適用し、ハイパーパramータは検証損失に基づいて調整する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、生の音声入力と制御パrameterから、非線形的かつ時間変動する音響コンプレッサーの挙動を学習できるか?
  • RQ2時間的文脈(ルックバック窓)のサイズが、コンプレッサー特性の再現能力にどのように影響するか?
  • RQ3このモデルは、アナログおよびソフトウェアコンプレッサーの主な知覚的・機能的特徴をどの程度捉えることができるか?
  • RQ4モデル出力における主な誤差要因は何か?また、有限なルックバックによる因果性が主な要因であるか?
  • RQ5このモデルは、音楽や合成波形など、異なる音声素材タイプおよびコンプレッサー設定に一般化できるか?

主な発見

  • モデルは、ソフトウェアベースおよびアナログ(Teletronix LA-2A)コンプレッサーの主な機能的・聴覚的特性を的確に捉えている。
  • 16,384~221,184サンプルの異なるルックバックサイズに対しても、検証損失は約1e-4に収束し、文脈長に対して高いロバスト性を示している。
  • 攻撃トランジェントの振幅が一貫して低く抑えられ、時々過剰圧縮が生じる傾向があることから、トランジェント応答のモデリングに限界があると示唆されている。
  • 非滑らかであるとされるコンプレス/リミットスイッチでも訓練に支障をきたさなかったため、勾配ベース最適化が滑らかでない制御パrameterを扱えることが示された。
  • 出力における残存ノイズは依然として大きな制限要因であり、プロフェッショナル音響ワークフローへの即時の導入を妨げている。
  • モデルの性能は、主に有限なルックバック窓に起因するものではなく、LA-2Aの5秒のリリース時間よりも長い範囲でも損失が低く保たれていることからも明らかである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。