Skip to main content
QUICK REVIEW

[論文レビュー] Learning Complex Basis Functions for Invariant Representations of Audio

Stefan Lattner, Monika Dörfler|arXiv (Cornell University)|Jul 13, 2019
Music and Audio Processing参考文献 35被引用数 4
ひとこと要約

本論文では、音声スペクトログラムから複素基底関数を学習することで変換不変表現を生成する深層学習アーキテクチャ、Complex Autoencoder (CAE) を提案する。音声を直交変換(例:トランスポジション、タイムシフト)に対して不変なマグニチュード空間と、変換の違いを符号化する位相空間に投影することにより、音声-スコアアライメントおよび繰り返しセクション同定の分野で最先端の性能を達成し、Chroma や GAE を用いた特徴量を上回る。

ABSTRACT

Learning features from data has shown to be more successful than using hand-crafted features for many machine learning tasks. In music information retrieval (MIR), features learned from windowed spectrograms are highly variant to transformations like transposition or time-shift. Such variances are undesirable when they are irrelevant for the respective MIR task. We propose an architecture called Complex Autoencoder (CAE) which learns features invariant to orthogonal transformations. Mapping signals onto complex basis functions learned by the CAE results in a transformation-invariant "magnitude space" and a transformation-variant "phase space". The phase space is useful to infer transformations between data pairs. When exploiting the invariance-property of the magnitude space, we achieve state-of-the-art results in audio-to-score alignment and repeated section discovery for audio. A PyTorch implementation of the CAE, including the repeated section discovery method, is available online.

研究の動機と目的

  • 音声情報検索(MIR)における不要な変換(例:トランスポジション、タイムシフト)に対して感受性が強いハンドクラフト特徴量の限界を解消すること。
  • フーリエ変換や CQT のような固定変換に依存せず、データから基底関数を学習する手法を開発すること。
  • 直交変換に対して不変なマグニチュード空間と、変換の種別と距離を符号化する位相空間を生成すること。
  • 不変表現を通じて、音声-スコアアライメントや繰り返しセクション同定といった MIR タスクの性能を向上させること。
  • MNIST をベンチマークとして用い、回転などの他の不変性への一般化を示すこと。

提案手法

  • CAE は、複素数値の重みと活性化を備えたオートエンコーダー構造を用い、定常Q変換(CQT)された音声表現から複素基底関数を学習する。
  • モデルは直交変換(例:トランスポジション、タイムシフト)によって関連付けられたデータペアを用い、複素数ドメインにおける再構成損失を最小化することで学習する。
  • 符号化表現のマグニチュードが変換不変空間を形成する一方、位相は変換固有の情報を符号化する。
  • マグニチュード空間は不変性を要する下流タスクに使用され、位相空間は信号間の変換種別および距離の推論を可能にする。
  • 変換に関する明示的なラベルが不要なため、教師なしで学習される。
  • 回転などの他の不変性にも一般化可能であり、回転した数字を用いた MNIST データセットでもその有効性が示された。

実験結果

リサーチクエスチョン

  • RQ1音声データから複素基底関数を学習することで、CQT や Chroma のような固定変換よりもより頑健で変換不変な表現が得られるか?
  • RQ2CAE のマグニチュード空間は、音声-スコアアライメントにおいて、既存の手法よりもトランスポジションやタイムシフトに対してより優れた不変性を達成するか?
  • RQ3CAE の位相空間は、音声断片間の変換種別と距離を効果的に符号化でき、より優れた構造解析を可能にするか?
  • RQ4テンポの変化に対して、CAE は GAE を用いた特徴量よりも頑健か?
  • RQ5CAE は、画像分類のような非音声分野においても、回転などの他の不変性に一般化可能か?

主な発見

  • CAE は、トランスポジション不変な繰り返しセクション同定において、Chroma や GAE を用いた特徴量を上回り、最先端の性能を達成した。
  • 音声-スコアアライメントにおいて、CAE 特徴量は Chroma や GAE を用いた特徴量よりも優れており、特にテンポの変化がある状況でも顕著に優れた結果を示した。
  • 回転させた MNIST データセットにおいて、CAE のマグニチュード空間上でロジスティック回帰を実行したところ、入力空間よりも顕著に低い誤差率が得られ、学習基底関数が 256 個でも十分であった。
  • PCA 視覚化において、CAE のマグニチュード空間は明確にクラス分離されたクラスタを形成しており、回転に対して強い不変性を示した。
  • CAE の位相差空間は、変換種別(例:回転角度)を明確に表現しており、信号間関係の判別的解析を可能にした。
  • CAE は 1000 個の基底関数を用いた GAE よりも、わずか 256 個の基底関数で優れた性能を達成したため、不変性を明示的に学習する手法が、より効率的かつ効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。