Skip to main content
QUICK REVIEW

[論文レビュー] Classification with Joint Time-Frequency Scattering.

Joakim Andén, Vincent Lostanlen|arXiv (Cornell University)|Jul 24, 2018
Music and Audio Processing参考文献 50被引用数 9
ひとこと要約

本稿では、固定されたウェーブレットベースのフィルタを備えた深層畳み込みニューラルネットワークとしての、共同時間周波数スキャattering変換を導入する。この手法は、時間的および周波数的両方のスケールでエネルギー分布を捉える。音声分類タスクにおいて最先端の性能を達成し、時間スキャatteringよりも優れており、学習済みネットワークと同等の精度を示す。

ABSTRACT

In time series classification, signals are typically mapped into some intermediate representation which is used to construct models. We introduce the joint time-frequency scattering transform, a locally time-shift invariant representation which characterizes the multiscale energy distribution of a signal in time and frequency. It is computed through wavelet convolutions and modulus non-linearities and may therefore be implemented as a deep convolutional neural network whose filters are not learned but calculated from wavelets. We consider the progression from mel-spectrograms to time scattering and joint time-frequency scattering transforms, illustrating the relationship between increased discriminability and refinements of convolutional network architectures. The suitability of the joint time-frequency scattering transform for characterizing time series is demonstrated through applications to chirp signals and audio synthesis experiments. The proposed transform also obtains state-of-the-art results on several audio classification tasks, outperforming time scattering transforms and achieving accuracies comparable to those of fully learned networks.

研究の動機と目的

  • 時系列データの時間周波数不変表現を開発し、分類タスクにおける判別能を向上させること。
  • 従来のスペクトログラムと学習済み深層ネットワークの間のギャップを埋めるために、構造的で学習なしの特徴抽出器を導入すること。
  • 時間のみのスキャatteringと比較して、共同時間周波数スキャatteringが優れていることを示すこと。また、完全に訓練されたネットワークと同等の性能を達成すること。
  • メルスペクトログ램から時間スキャatteringへ、そして最終的に共同時間周波数スキャatteringへのアーキテクチャの進化が、特徴品質および分類精度に与える影響を分析すること。

提案手法

  • 共同時間周波数スキャattering変換は、ウェーブレット畳み込みと絶対値非線形性を用い、局所的な時間シフト不変性を持つ表現を生成する。
  • フィルタは学習されたものではなくウェーブレットから導出されるため、固定され、解釈可能な特徴抽出パイプラインを実現する。
  • アーキテクチャは学習可能なパラメータを持たない深層畳み込みニューラルネットワークとして構築され、事前に定義されたウェーブレットフィルタに依存する。
  • この手法は、時間的および周波数的両領域における信号のマルチスケールエネルギー分布を捉える。
  • 時間スキャatteringを基盤とし、周波数シフトに対しても不変性を拡張することで、より高いロバスト性と判別能を実現する。

実験結果

リサーチクエスチョン

  • RQ1共同時間周波数スキャatteringは、音声分類において時間のみのスキャatteringと比較して、どのように判別能を向上させるか?
  • RQ2固定で学習なしのウェーブレットベースのネットワークが、完全に訓練された深層ネットワークと同等の性能を達成できるか、その程度はいかほどか?
  • RQ3メルスペクトログラムから時間スキャattering、そして共同時間周波数スキャatteringへの段階的進化が、特徴品質および分類精度に与える影響は何か?
  • RQ4共同時間周波数不変性は、信号の摂動に対してロバスト性をどのように向上させるか?

主な発見

  • 共同時間周波数スキャattering変換は、複数の音声分類ベンチマークで最先端の性能を達成した。
  • 時間スキャattering変換を上回り、周波数ドメインにおける不変性の導入が有効であることを示した。
  • 学習可能なパラメータが一切ないにもかかわらず、完全に訓練された深層ニューラルネットワークと同等の分類精度を達成した。
  • チープ信号および音声合成データを効果的に特徴付け、強力な表現力を持つことを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。