Skip to main content
QUICK REVIEW

[論文レビュー] Cross-modal variational inference for bijective signal-symbol translation

Axel Chemla--Romeu-Santos, Stavros Ntalampiras|arXiv (Cornell University)|Feb 10, 2020
Music and Audio Processing被引用数 4
ひとこと要約

本論文は、共有された潜在空間を備えた2つのドメイン固有の変分オートエンコーダー(VAE)を用いて、クロスモーダルな信号-記号翻訳を実現する一対一対応の変分推論ベースのフレームワークを提案する。潜在表現同士の加法的マッチングを強制することで、音声から記号への変換(音声→記号)と記号から音声への合成(記号→音声)の双方向生成が可能となり、任意の記号語彙と連続的潜在空間の探索によるクリエイティブ制御をサポートする。

ABSTRACT

Extraction of symbolic information from signals is an active field of research enabling numerous applications especially in the Musical Information Retrieval domain. This complex task, that is also related to other topics such as pitch extraction or instrument recognition, is a demanding subject that gave birth to numerous approaches, mostly based on advanced signal processing-based algorithms. However, these techniques are often non-generic, allowing the extraction of definite physical properties of the signal (pitch, octave), but not allowing arbitrary vocabularies or more general annotations. On top of that, these techniques are one-sided, meaning that they can extract symbolic data from an audio signal, but cannot perform the reverse process and make symbol-to-signal generation. In this paper, we propose an bijective approach for signal/symbol translation by turning this problem into a density estimation task over signal and symbolic domains, considered both as related random variables. We estimate this joint distribution with two different variational auto-encoders, one for each domain, whose inner representations are forced to match with an additive constraint, allowing both models to learn and generate separately while allowing signal-to-symbol and symbol-to-signal inference. In this article, we test our models on pitch, octave and dynamics symbols, which comprise a fundamental step towards music transcription and label-constrained audio generation. In addition to its versatility, this system is rather light during training and generation while allowing several interesting creative uses that we outline at the end of the article.

研究の動機と目的

  • 音楽情報検索分野における片側的かつ一般化されない信号→記号変換手法の限界を解消すること。
  • 統一された生成モデルを用いて、音声信号と記号的アノテーション(例:音高、ダイナミクス、オクターブ)の間で双方向翻訳を可能にすること。
  • 基本的な音高検出を超えて、トリルやプレイモードなどの複雑な楽器記号を含む、任意の記号語彙をサポートすること。
  • 信号と記号の両方の生成に統一された潜在空間を提供し、クリエイティブな音声合成と制御を可能にすること。
  • ソース分離を明示的な分解と統合することで、楽器認識の向上とモデルの解釈可能性の向上を図ること。

提案手法

  • 音声と記号的ドメインの両方における同時密度推定問題として、信号-記号翻訳を定式化する。
  • スペクトル特徴(信号)用と記号的アノテーション(例:音高、ダイナミクス)用の2つの別個のVAEを訓練し、それらに共有された潜在空間を導入する。
  • 2つのVAEの潜在表現同士の潜在空間の整合性を、加法的制約を用いて強制することで、クロスドメイン推論を可能にする。
  • 両方のドメインの潜在変数の事後分布を近似するために変分推論を用いる。
  • 片方のドメインの潜在コードを、もう片方のドメインのデコーダーでデコードすることで、クロスドメイン生成を実現する(例:信号エンコーダー → 記号デコーダー)。
  • 混合係数のベイジアン推論ネットワークを用いた、独立したデコーダーを備えた新規なソース分離モジュールを統合する。

実験結果

リサーチクエスチョン

  • RQ1統一された変分オートエンコーダーのフレームワークは、音声信号と楽器的記号的アノテーションの間で、双方向的かつ一対一対応の翻訳を達成できるか?
  • RQ2このようなモデルは、標準的な音高やダイナミクスを超えて、任意の記号語彙へ一般化して機能するか?
  • RQ3潜在空間の共有は、制御可能な音声合成と記号的生成をどの程度可能にするか?
  • RQ4スペクトルモーフィングや潜在空間内のシーケンスベースナビゲーションといった、クリエイティブな音声生成タスクをサポートできるか?
  • RQ5明示的なソース分離の統合は、多楽器混合音楽の変換性能をどの程度向上させるか?

主な発見

  • モデルは双方向翻訳を達成しており、共有された構造的潜在空間を用いて、正確な信号→記号変換と記号→信号生成を実現している。
  • システムは、トリルやアーティキュレーションなどの複雑な楽器記号を含む、任意の記号語彙をサポートしており、柔軟でユーザー定義可能なアノテーション方式を可能にしている。
  • 潜在空間の探索により、スペクトルモーフィング、自由な軌道ナビゲーション、シーケンスベース音声生成といった多様なクリエイティブ応用が可能になった。
  • 記号ラベル(例:特定の音高、ダイナミクス)に条件づけて生成することで、半教師あり生成が可能となり、多様な音声実現が得られる。
  • 独立したデコーダーを備えたソース分離の統合により、楽器認識が向上し、多楽器混合音のより正確な分解が可能になった。
  • 訓練および推論の両段階において計算効率が高く、リアルタイムおよびインタラクティブな応用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。