Skip to main content
QUICK REVIEW

[論文レビュー] Neural Synthesis of Footsteps Sound Effects with Generative Adversarial Networks

Marco Comunità, Huy Phan|arXiv (Cornell University)|Oct 18, 2021
Music and Audio Processing参考文献 34被引用数 6
ひとこと要約

本論文は、ハイブリッドWaveGAN生成器とHiFi-GAN識別器を用いて、歩行音効果の神経的合成に生成的対抗ネットワーク(GAN)を初めて適用した。この手法は、主観的聴取テストにおいて、実際の録音と同等のリアリズムスコアを達成し、従来の手続き的およびスペクトルモデリング手法を上回った。

ABSTRACT

Footsteps are among the most ubiquitous sound effects in multimedia applications. There is substantial research into understanding the acoustic features and developing synthesis models for footstep sound effects. In this paper, we present a first attempt at adopting neural synthesis for this task. We implemented two GAN-based architectures and compared the results with real recordings as well as six traditional sound synthesis methods. Our architectures reached realism scores as high as recorded samples, showing encouraging results for the task at hand.

研究の動機と目的

  • 従来の手続き的またはサンプリングされた音声手法の代替として、特にGANを用いた深層生成モデルによる歩行音効果の神経的合成を検討すること。
  • GANベースのモデルが、現実世界の録音と同等の知覚的リアリズムを持つ歩行音を生成できるかどうかを評価すること。
  • 制御された聴取テストにおいて、神経的合成モデルと6つの既存の従来手法の性能を比較すること。
  • アップサンプリング手法や識別器設計などのGANのアーキテクチャ的選択が、音声品質およびデータ分布の近似に与える影響を調査すること。
  • 特に人間の知覚を考慮して、音声品質と知覚的リアリズムの役割の相違を評価すること。

提案手法

  • Zapsplatから収集した81件の高品質な歩行音録音(16kHz、-6dBFS)から、カーペット、デッキ、金属、アスファルト、ラグ、木、木製内部の7種類の表面で高級ヒールを履いた状態をカバーする、カスタムデータセットを構築した。
  • 生成器は、5段の逆畳み込み1次元層、バッチ正規化、潜在ノイズ入力を備えた条件付きWaveGANアーキテクチャを採用し、ゼロスタッキングまたは補間を用いてアップサンプリングして8192サンプル(約0.5秒)にした。
  • ハイブリッド識別器は、条件付きWaveGAN識別器とHiFi-GANのマルチリゾリューションアーキテクチャを組み合わせ、リアリズムとデータ分布の一致を向上させた。
  • 標準的な条件付きWaveGANとハイブリッドWaveGAN-HiFi-GANモデルの2つのアーキテクチャを訓練した。両者とも表面および靴の種類に条件付けられたものである。
  • 客観的指標(例:FID)と19名の経験豊富な音声専門家を対象とした主観的聴取テストを用いて、モデルを評価した。
  • 音声サンプルは8192サンプル(0.5秒)で合成され、一定のペースで複数のサンプルを連結することで10秒分の歩行をシミュレートした。

実験結果

リサーチクエスチョン

  • RQ1GANベースの神経的合成は、実録音と同等の知覚的リアリズムを持つ歩行音効果を生成できるか?
  • RQ2ハイブリッドWaveGAN-HiFi-GANアーキテクチャは、標準的なWaveGANおよび従来の手続き的合成手法に比べ、音声品質およびリアリズムの面でどのように差をつけるか?
  • RQ3音声品質と知覚的リアリズムの相関関係は、歩行音効果においてどの程度強いのか?
  • RQ4アップサンプリング手法や識別器設計といった、アーキテクチャ的選択のうち、合成された歩行音のリアリズムに最も顕著な影響を与えるのはどれか?
  • RQ5神経的合成モデルは、ビデオゲームなどの応用分野において、リアルタイム合成の可能性を維持しつつ、最先端のリアリズムを達成できるか?

主な発見

  • ハイブリッドWaveGAN-HiFi-GANモデルは、主観的聴取テストにおいて、実録音と統計的に区別できないリアリズムスコアを達成し、すべての従来の合成手法を上回った。
  • WaveGANおよびHiFi-WaveGANモデルの両方とも、実録音と同等の平均リアリズムスコアを獲得しており、強力な知覚的忠実度を示した。
  • WaveGANモデルは顕著なバックグラウンドノイズと歪みを示したが、HiFi-WaveGANモデルはよりクリアで自然な出力を得ており、音声品質の向上が示された。
  • アップサンプリングにゼロスタッキングを使用した場合、最近傍補間、線形補間、立方補間よりも知覚的品質で優れていた。これは、GAN文献における一般的な仮定とは逆であった。
  • Farnellの手続き的モデルや統計的モデリングといった従来手法は、顕著に低いスコアを記録し、非ニューラル手法が複雑で帯域が広いインパルス音に限界を示すことを示した。
  • 結果から、音声品質そのものが知覚的リアリズムを完全に決定するわけではないことが示された。スペクトルエンVELOープ やトランジェント特性といった、他の知覚的要因が人間の判断において重要な役割を果たすことがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。