Skip to main content
QUICK REVIEW

[論文レビュー] Sound texture synthesis using convolutional neural networks

Hugo Caracalla, Axel Röebel|arXiv (Cornell University)|May 9, 2019
Music and Audio Processing参考文献 10被引用数 9
ひとこと要約

本稿では、時間領域で最適化することで位相再構成を回避し、対象のテクスチャの特徴マップの時間的相互相関を一致させることで、時間領域信号を最適化する2次元畳み込みニューラルネットワーク(CNN)を用いた新しいパラメトリック音響テクスチャ合成手法を提案する。この手法により、特徴的なイベントを含む多様なテクスチャ—特に、個々のテクスチャに合わせたハイパーパrameterチューニングを必要としない高品質な合成が可能になる。

ABSTRACT

The following article introduces a new parametric synthesis algorithm for sound textures inspired by existing methods used for visual textures. Using a 2D Convolutional Neural Network (CNN), a sound signal is modified until the temporal cross-correlations of the feature maps of its log-spectrogram resemble those of a target texture. We show that the resulting synthesized sound signal is both different from the original and of high quality, while being able to reproduce singular events appearing in the original. This process is performed in the time domain, discarding the harmful phase recovery step which usually concludes synthesis performed in the time-frequency domain. It is also straightforward and flexible, as it does not require any fine tuning between several losses when synthesizing diverse sound textures. A way of extending the synthesis in order to produce a sound of any length is also presented, after which synthesized spectrograms and sound signals are showcased. We also discuss on the choice of CNN, on border effects in our synthesized signals and on possible ways of modifying the algorithm in order to improve its current long computation time.

研究の動機と目的

  • 静的および非静的テクスチャ、特に顕著なフォアグラウンドイベントを含むテクスチャを再現できる柔軟でパラメトリックな音響テクスチャ合成手法の開発。
  • 物理ベースやグランラー合成などの従来手法の限界を克服し、深層学習を活用することで、より広範な適用性と高い知覚的品質を実現すること。
  • 時間領域での直接最適化により位相再構成の必要性を排除し、より頑健でシンプルな合成パイプラインを実現すること。
  • 個々のテクスチャに合わせたハイパーパrameterチューニングを必要とせず、長時間の合成とパrameter操作を可能にすること。
  • 計算効率の低さと合成信号における端縁アーチファクトの問題を、アーキテクチャ的および表現レベルの改善によって解決すること。

提案手法

  • 本手法は、対象音響テクスチャのログスペクトログラムから特徴マップを抽出する2次元CNNを用い、これらのマップ間の時間的相互相関をパラメトリックな記述子として計算する。
  • ランダムに初期化された時間領域信号を勾配降下法を用いて繰り返し最適化し、合成信号の特徴マップ相互相関と対象のものとの差を最小化する。
  • 最適化は時間領域で直接実行されるため、通常時間周波数領域での合成に必要な位相再構成を回避できる。
  • 各新しいテクスチャに合わせた微調整を必要としないように、ランダムで未学習のフィルタでネットワークを初期化することで、多様なテクスチャに柔軟に対応する。
  • 元の信号長を超えて最適化プロセスを延長することで、長時間の合成を実現し、時間的整合性を維持する。
  • アーチファクトが局所的で内部に近づくにつれて急速に減少することを踏まえ、出力の先頭および末尾のセグメントをクロップすることで端縁効果を軽減する。

実験結果

リサーチクエスチョン

  • RQ1CNN特徴マップの時間的相互相関は、パラメトリック音響テクスチャ合成のための効果的で汎用的なパラメータとして適しているか?
  • RQ2これらのパラメータを用いた時間領域最適化により、位相再構成を経ずに高品質で知覚的に妥当なテクスチャを生成できるか?
  • RQ3本手法は、ランダムなバックグラウンドイベントと明確に識別可能なフォアグラウンドイベントを併せ持つテクスチャも合成できるか?
  • RQ4本手法は、知覚的品質を維持したまま、任意に長い音響テクスチャを生成できるように拡張可能か?
  • RQ5計算時間を短縮するためのアーキテクチャ的および表現的選択肢は何か?

主な発見

  • 本手法は、風、雨、小鳥のさえずり、炎などの多様なカテゴリにわたり、特徴的なフォアグラウンドイベントを含む高品質な音響テクスチャを合成に成功している。
  • 合成信号は元の信号とは知覚的に明確に異なるが、コアとなるテクスチャ的特徴を保持しており、再合成の目的を満たしている。
  • 本アルゴリズムは、個々のテクスチャに合わせたハイパーパrameterチューニングを一切必要とせず、さまざまなテクスチャタイプにわたり簡便かつ柔軟に適用可能である。
  • 端縁アーチファクトは合成信号の開始および終了部に現れるが、最大フィルタサイズ(27フレーム)程度の長さにとどまり、クロップによって容易に除去可能である。
  • 計算時間は依然として高く(1GPUで12秒分の音声で約1時間)、しかしパrameterテンソルをサブサンプリングすることで、100Mから約1600万パラメータに削減でき、短縮が可能である。
  • ログスペクトログラム上で離れた位置に存在するイベント間の相関を再現する能力に限界があることが示唆されており、長距離時間的モデリングに課題がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。