Skip to main content
QUICK REVIEW

[論文レビュー] Uncovering audio patterns in music with Nonnegative Tucker Decomposition for structural segmentation

Axel Marmoret, Jérémy E. Cohen|arXiv (Cornell University)|Oct 11, 2020
Music and Audio Processing参考文献 2被引用数 5
ひとこと要約

本稿では、時間周波数バー三次テンソル表現を用いて、ポップ音楽におけるバー単位の音楽的パターンを解明するための非負値タッカー分解(NTD)を提案する。この手法により、効果的な構造的セグメンテーションが可能となる。最適なランクが選択された場合、ベースライン手法を上回り、最先端の結果に近い性能を達成しており、スパースで解釈可能な音声特徴抽出の可能性を示している。

ABSTRACT

Recent work has proposed the use of tensor decomposition to model repetitions and to separate tracks in loop-based electronic music. The present work investigates further on the ability of Nonnegative Tucker Decompositon (NTD) to uncover musical patterns and structure in pop songs in their audio form.Exploiting the fact that NTD tends to express the content of bars as linear combinations of a few patterns, we illustrate the ability of the decomposition to capture and single out repeated motifs in the corresponding compressed space, which can be interpreted from a musical viewpoint. The resulting features also turn out to be efficient for structural segmentation, leading to experimental results on the RWC Pop data set which are potentially challenging state-of-the-art approaches that rely on extensive example-based learning schemes.

研究の動機と目的

  • ポップソングの中期的音楽的構造を捉えるスパースで解釈可能な音声表現を開発すること。
  • 非負値タッカー分解(NTD)が、生の音声スペクトログラムから顕著なバー単位のパターンを抽出できるかどうかを調査すること。
  • RWC Popデータセット上で、NTDから得られる特徴量の構造的セグメンテーションへの有効性を評価すること。
  • 無知な手法とデータ集約型の最先端手法とを比較して、NTDに基づくセグメンテーションを評価すること。

提案手法

  • F=12(クロマ)であり、Tはバーごとのフレーム数、Bは合計バー数であるF×T×Bのサイズの三次テンソルXとして音楽を表現する。これは、定常Q変換からのクロマグラムを用いる。
  • 低ランク圧縮を達成するために、非負値タッカー分解(NTD)を用いてXをコアテンソル𝒢と3つの非負の要因行列W、H、Qに因子分解する。
  • コアテンソルと要因行列を用いて、各バーの圧縮表現を再構築し、少数の基本成分の線形結合によるパターン発見を可能にする。
  • 圧縮表現から自己類似性行列を構築し、繰り返しモチーフと構造的境界を検出する。
  • セグメンテーションのFスコアを最大化するために、NTDのランクT′とB′を交差検証およびオラクル選択により最適化する。
  • 0.5秒および3秒の許容ウィンドウを用いて、精度、再現率、Fスコアを用いてセグメンテーション性能を評価し、ベースライン手法および生のクロマグラムに基づく自己類似性と比較する。

実験結果

リサーチクエスチョン

  • RQ1非負値タッカー分解は、生の音声からポップ音楽における繰り返し音楽的モチーフ(バー単位)を効果的に解明できるか?
  • RQ2NTDから得られる特徴表現は、構造的セグメンテーションにおいて生の時間周波数表現と比較してどのように異なるか?
  • RQ3ランク選択(T′, B′)がセグメンテーション性能に与える影響は何か?また、オラクルに近いランク選択は性能の上限を示すことができるか?
  • RQ4NTDベースのアプローチは、無知なセグメンテーション手法を上回り、データ集約型の最先端技術と同等の性能を発揮できるか?
  • RQ5NTD表現は、構造的境界検出のための自己類似性行列のコントラストをどの程度向上させるか?

主な発見

  • 現実的な交差検証条件下で、NTDベースのセグメンテーションは、ベースラインの無知な手法を上回り、RWC Popデータセットで競争力のあるFスコアを達成した。
  • オラクルランク選択を用いることで、NTDは最先端の手法を上回るFスコアを達成した。これは、効果的なランク選択と組み合わせた場合の強力な潜在的性能を示している。
  • NTDから得られる自己類似性行列は、生のクロマグラムからのものよりもコントラストが高く、構造的境界の検出を向上させた。
  • この手法は自然にセグメント境界をダウンビートに一致させ、ポップ音楽においてセクションがしばしばダウンビートで始まることを考慮すると、バイアス的な利点を有する可能性がある。
  • コアテンソルと要因行列は、圧縮表現内で繰り返しのコード進行やメロディックモチーフといった解釈可能な音楽的パターンを明らかにした。
  • ランクT′とB′は性能に顕著な影響を与え、交差検証では奇数の楽曲でそれぞれ40と28、偶数の楽曲でそれぞれ48と24の最適値が得られ、オラクル条件下では楽曲ごとに異なる値が最適であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。