Skip to main content
QUICK REVIEW

[論文レビュー] Neural Granular Sound Synthesis

Adrien Bitton, Philippe Esling|arXiv (Cornell University)|Aug 4, 2020
Music Technology and Sound Studies被引用数 5
ひとこと要約

本稿では、従来の音声記述子に代わり変分自己オートエンコーダ(VAE)によって学習された潜在空間を用いるニューラルグレイン音声合成手法を提案する。これにより、連続的かつ可逆的な合成と構造的な時系列モデリングが可能となり、条件付きサンプリング、モーフィング、多様な音色タイプにおいて高品質な聴覚的性能を示すリアルタイム音声生成といった新たな合成モードを実現する。

ABSTRACT

Granular sound synthesis is a popular audio generation technique based on rearranging sequences of small waveform windows. In order to control the synthesis, all grains in a given corpus are analyzed through a set of acoustic descriptors. This provides a representation reflecting some form of local similarities across the grains. However, the quality of this grain space is bound by that of the descriptors. Its traversal is not continuously invertible to signal and does not render any structured temporality. We demonstrate that generative neural networks can implement granular synthesis while alleviating most of its shortcomings. We efficiently replace its audio descriptor basis by a probabilistic latent space learned with a Variational Auto-Encoder. In this setting the learned grain space is invertible, meaning that we can continuously synthesize sound when traversing its dimensions. It also implies that original grains are not stored for synthesis. Another major advantage of our approach is to learn structured paths inside this latent space by training a higher-level temporal embedding over arranged grain sequences. The model can be applied to many types of libraries, including pitched notes or unpitched drums and environmental noises. We report experiments on the common granular synthesis processes as well as novel ones such as conditional sampling and morphing.

研究の動機と目的

  • 従来のグレイン音声合成における制限、すなわち可逆でないグレイン空間と手作業で設計された音響記述子への依存を克服すること。
  • VAEを用いて生のグレインから確率的潜在空間を学習することで、連続的かつ微分可能な合成を実現すること。
  • 上位レベルの時系列埋め込みを用いてグレイン系列の構造的な時系列ダイナミクスをモデリングし、表現力豊かな音声生成を実現すること。
  • オリジナルのグレインを保存せずに、リシントランス、モーフィング、条件付きサンプリングなどの多様な合成タスクをサポートすること。
  • 音声再構成の高精細度と、音楽的作曲およびインタラクティブシステムに適したリアルタイム生成を達成すること。

提案手法

  • 音声コーパスから抽出されたグレインを対象にVAEを訓練し、グレイン音響を表す連続的かつ可逆的な潜在空間を学習する。
  • VAEの潜在空間により連続的合成が可能となり、潜在空間内の任意の点をデコードすることで、新規で現実的であるグレイン波形が生成可能である。
  • グレイン特徴の系列を対象に別個の時系列モデル(時系列埋め込み)を訓練し、潜在空間内で構造的かつ時系列に整合性のある軌道を学習する。
  • ユーザー定義のターゲット(例:ピッチ、楽器種別、ターゲット信号特徴)をVAEデコーダに条件付けすることで、条件付き生成を実現する。
  • 自由な合成は、潜在空間パス(例:直線、円形、らせん)をサンプリングし、重ね合わせ加算で結合することで実現する。
  • GPU上での最適化された推論によりリアルタイム合成を実現し、Max/MSPなどのインタラクティブ環境へのOSC統合を実装する。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルが、連続的かつ可逆的な合成を可能にしつつ、手作業で設計された音響記述子を置き換えることができるか?
  • RQ2教師信号のない音声信号アライメントに依存せず、グレイン系列から構造的な時系列ダイナミクスを学習できる階層的潜在空間モデルは構築可能か?
  • RQ3モデルは、ピッチのある音符、ピッチのないドラム、環境音など多様な音色タイプに一般化可能か?
  • RQ4ベースライン手法と比較して、データ駆動型のリシントランス、モーフィング、条件付き音声生成の性能はどの程度か?
  • RQ5モデルは、トーンや時系列的変化に対する表現力のある制御が可能なリアルタイムでインタラクティブな音声合成を可能にするか?

主な発見

  • 提案モデルは、多様なデータセットで最先端の再構成品質を達成し、Studio-On-Line ordinarioデータセットではRMSEが4.86、LSDが1.17を記録した。
  • 8 Drumsデータセットでは、RMSEが2.79、LSDが0.52を達成し、ピッチのないトランジェント豊富な音色においても優れた性能を示した。
  • 潜在空間の連続的走査により、直線的、円形、らせん的パスを含め、滑らかで聴覚的に整合性のある音声合成が可能となった。
  • ピッチや楽器種別に基づく条件付きサンプリングにより、表現力豊かな的確なリシントランスとトーン移行が実現した。
  • 潜在空間での補間により、異なる音色種別間のモーフィングが実現され、自然な聴覚的遷移が得られた。
  • 推論速度が1イテレーションあたり約0.54~2.87秒の高速さを実現し、リアルタイム音声生成とインタラクティブアプリケーションが可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。