Skip to main content
QUICK REVIEW

[論文レビュー] Equivariant Self-Supervision for Musical Tempo Estimation

Elio Quinton|arXiv (Cornell University)|Sep 3, 2022
Music and Audio Processing被引用数 4
ひとこと要約

本論文は、音声の時間伸縮に対する等長性を事前学習タスクとして用いる、音楽テンポ推定のための新規自己教師付き学習手法を提案する。ラベル付きデータ、ネガティブサンプリング、正則化の必要性を排除し、ラベルなし音声と中程度の計算リソースのみを用いて、複数のベンチマークで教師あり手法と同等の性能を達成する。

ABSTRACT

Self-supervised methods have emerged as a promising avenue for representation learning in the recent years since they alleviate the need for labeled datasets, which are scarce and expensive to acquire. Contrastive methods are a popular choice for self-supervision in the audio domain, and typically provide a learning signal by forcing the model to be invariant to some transformations of the input. These methods, however, require measures such as negative sampling or some form of regularisation to be taken to prevent the model from collapsing on trivial solutions. In this work, instead of invariance, we propose to use equivariance as a self-supervision signal to learn audio tempo representations from unlabelled data. We derive a simple loss function that prevents the network from collapsing on a trivial solution during training, without requiring any form of regularisation or negative sampling. Our experiments show that it is possible to learn meaningful representations for tempo estimation by solely relying on equivariant self-supervision, achieving performance comparable with supervised methods on several benchmarks. As an added benefit, our method only requires moderate compute resources and therefore remains accessible to a wide research community.

研究の動機と目的

  • テンポ推定における手作業による音楽データの不足と高コストを解決すること。
  • 教師ありまたは対照的学習を超えた音楽表現学習における自己教師付き学習の可能性を調査すること。
  • 等長性を明示的に捉えることで、リズム構造を捉える自己教師付きフレームワークを構築すること。
  • モデルの崩壊を防ぐためにネガティブサンプリングや正則化に依存しないこと。
  • 等長性に基づく自己教師付き学習が、テンポ推定に適した強固で転移可能な表現を生成できることを示すこと。

提案手法

  • 2つの音声サンプルのビューを、既知の要因を用いたランダムな時間伸縮によって作成する、シアンプスネットワークアーキテクチャを用いる。
  • モデルは時間伸縮に対して予測可能に変化する表現を生成するように学習され、不変性ではなく等長性を強制する。
  • 時間伸縮されたバージョン間の期待される表現の関係を強制する新しい損失関数が導出され、正則化なしに自明な解を防ぐ。
  • 音声の拡張(例:ピッチシフト、マスキング)を適用して、テンポ以外の信号変動に対する頑健性を向上させる。
  • 事前学習の後、テンポを多クラス分類問題として扱い、下流のテンポ推定タスクで線形プローブによる微調整を行う。
  • 本手法は、複数のベンチマーク(GTZAN、ACM Mirum、Hainsworth、Giantsteps)でゼロショットおよび微調整プロトコルを用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1等長性に基づく自己教師付き学習は、ラベルなしデータのみで意味のあるテンポ表現を学習できるか?
  • RQ2シンプルで正則化なしの損失関数は、音声の自己教師付き学習におけるモデルの崩壊を防げるか?
  • RQ3等長性に基づく事前学習は、教師あり手法と同等の性能を示す表現を生成できるか?
  • RQ4学習済み表現はドメインシフトやハイパーパrameterの選択に対してどれほど頑健か?
  • RQ5本手法はリソースが限られた音楽ジャンルや他のリズム関連MIRタスクへ一般化可能か?

主な発見

  • 提案手法は、全テストデータセットで教師ありベースラインと同等の性能を達成し、GTZANではAccuracy 1がすべての教師あり手法を上回った。
  • GTZANデータセットでは、Accuracy 2が0.958に達し、最良の教師ありベースラインと同等の性能を示した。
  • データセット全体にわたり高い性能を維持し、最適な微調整設定下でAccuracy 1はACM Mirumで0.846、Hainsworthで0.700、Giantstepsで0.952を記録した。
  • ドメインシフトに対しても頑健であり、事前学習時に未確認のデータセットに対しても良好に一般化した。
  • 時間伸縮拡張を用いた微調整は、全データセットで性能向上をもたらし、最適な強度はデータセットごとに異なることがわかった。
  • 線形ヘッドによる微調整のみで競争力のある結果が得られたことから、事前学習段階で強固で転移可能な表現が得られていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。