Skip to main content
QUICK REVIEW

[論文レビュー] Representation Learning of Music Using Artist, Album, and Track Information

Jongpil Lee, Jiyoung Park|arXiv (Cornell University)|Jun 27, 2019
Music and Audio Processing参考文献 8被引用数 7
ひとこと要約

本稿では、ジャンルや気分などの高価で曖昧な意味的ラベルの代わりに、実際のメタデータ(アーティスト、アルバム、トラック情報)を用いた自己教師付き表現学習手法を提案する。3秒間の音声セグメントに対してシアンズ型畳み込みニューラルネットワーク(CNN)を用い、対照的学習を実施することで、これらのメタデータタイプを統合的に学習し、特に3つのメタデータ源を併用した場合に、下流のジャンル分類タスクで最先端の性能を達成した。

ABSTRACT

Supervised music representation learning has been performed mainly using semantic labels such as music genres. However, annotating music with semantic labels requires time and cost. In this work, we investigate the use of factual metadata such as artist, album, and track information, which are naturally annotated to songs, for supervised music representation learning. The results show that each of the metadata has individual concept characteristics, and using them jointly improves overall performance.

研究の動機と目的

  • 実際の、自然に存在する音楽メタデータ(アーティスト、アルバム、トラック)が、教師あり表現学習に有効であるかを検討すること。
  • ジャンルや気分といった意味的ラベルを音楽に付与する際の高コストと曖昧さという問題に取り組むこと。
  • 複数のメタデータレベルからの統合学習が、単一のソースからの学習と比較して表現品質を向上させるかを評価すること。
  • ネガティブサンプル数とトレーニングデータサイズがモデル性能に与える影響を調査すること。
  • 外部のジャンルデータセットを用いた転移学習を通じて、学習された表現の一般化能力を評価すること。

提案手法

  • 3秒間の音声セグメントから表現を学ぶために、シアンズ型の畳み込みニューラルネットワーク(CNN)を用いる。
  • 正例(同じ概念)と負例(異なる概念)のペアを区別できるように、複数のネガティブサンプルを用いた対照的学習を採用する。
  • アーティスト(同じアーティスト)、アルバム(同じアルバム)、トラック(同じトラック)の3つの異なる類似性概念を定義し、それぞれに固有の正例/負例サンプリング戦略を適用する。
  • 3つの概念からの損失関数を統合し、3つのタスク間でパラメータを共有する統合学習モデルを構築する。
  • トレーニング、検証、テストにバランスの取れた分割を適用し、Bertin-Mahieuxら(2011)のメタデータを用いたMillion Song Datasetでモデルを学習する。
  • マージン値(アーティスト:0.4、アルバム:0.25、トラック:0.1)などのハイパーパrameterはグリッドサーチにより最適化する。

実験結果

リサーチクエスチョン

  • RQ1アーティスト、アルバム、トラックといった事実的メタデータが、音楽表現学習の有効な教師信号として機能するか。
  • RQ2複数のメタデータレベルからの統合学習は、個別に各メタデータタイプから学習するのと比べて、性能にどのように影響するか。
  • RQ3対照的学習におけるネガティブサンプル数がモデル性能に与える影響は何か。
  • RQ4トレーニングサンプル数が、学習された表現の質に与える影響は何か。
  • RQ5メタデータから学習した表現が、下流のジャンル分類タスクにどの程度一般化できるか。

主な発見

  • 統合モデルは個別モデルを上回り、トラック概念のホールドアウト正例/負例予測で0.945の精度を達成したのに対し、単一トラックモデルでは0.922であった。
  • アーティストモデルが転移学習で最高の性能を示し、GTZANデータセットで0.745のF1スコアを記録した。これはアルバムモデル(0.763)とトラックモデル(0.745)を上回った。
  • 3つのメタデータタイプを併用した統合学習は、最も優れた単一モデルをわずかに上回り、GTZANでは0.745のF1スコア、NAVER韓国データセットでは0.686のF1スコアを達成した。
  • ネガティブサンプル数を増やすことで性能が向上した:GTZANにおけるF1スコアは、ネガティブサンプル1個のとき0.665から、16個のとき0.711に上昇した。
  • トレーニングデータ量を増やすことで結果が改善した:GTZANにおけるF1スコアは、500アーティストのとき0.638から10,000アーティストのとき0.755に上昇し、FMA smallおよびNAVER韓国でも同様の傾向を示した。
  • 転移学習はGTZANおよびFMA smallでは最も効果的であったが、NAVER韓国では文化的な分布シフトのため、やや効果が薄かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。