Skip to main content
QUICK REVIEW

[論文レビュー] Hit Song Prediction Based on Early Adopter Data and Audio Features

Dorien Herremans, Tom Bergmans|arXiv (Cornell University)|Oct 16, 2020
Music and Audio Processing参考文献 4被引用数 7
ひとこと要約

本研究では、Last.FM における早期採用者のリスニング行動と EchoNest API からのオーディオ特徴量を組み合わせたハイブリッドヒットソング予測モデルを提案する。早期採用者データを用いたロジスティック回帰により、トップ20ダンスヒットの予測でAUC 0.79を達成し、オーディオ特徴量のみのモデルを上回り、チャート成功の前触れとしての社会的リスニングパターンの予測可能性を示した。

ABSTRACT

Billions of USD are invested in new artists and songs by the music industry every year. This research provides a new strategy for assessing the hit potential of songs, which can help record companies support their investment decisions. A number of models were developed that use both audio data, and a novel feature based on social media listening behaviour. The results show that models based on early adopter behaviour perform well when predicting top 20 dance hits.

研究の動機と目的

  • 早期採用者のソーシャルメディアリスニング行動とオーディオ特徴量を統合することで、ヒットソング予測の精度を向上させること。
  • 従来のモデルがオーディオまたはメタデータにのみ依存するという限界を克服し、リアルタイムのリスニングダイナミクスを組み込むこと。
  • Last.FM などのプラットフォームにおける早期採用者の行動が、チャート順位が現れる前から将来のヒット可能性を示すという仮説を検証すること。
  • 将来の研究のためのベンチマークデータセットを構築すること。このデータセットには、Ultratop 50 ヒットデータ、Bubbling Under チャート非ヒットデータ、およびクリーニング済みの Last.FM リスニング記録を含む。

提案手法

  • 2011–2013年のベルギーの Ultratop 50 ダンスチャートから 8,750 首を収集し、上位20位をヒットとラベル付け、その後もチャートに上がらなかった Bubbling Under 歌曲をノンヒットとラベル付けした。
  • EchoNest API を用いて 140 のオーディオ特徴量を抽出した。時間的・知覚的特徴量(例:ダンス性、ホットネス)を含み、事前に計算されたメタ特徴量を除いた別々のデータセットも用意した。
  • 6か月間の期間にわたり、3つのユーザーグループ(例:「一貫して新しいダンス・エレクトロニカ」など)から合計 854,060 件の Last.FM リスニング記録を収集・クリーニングした。
  • 累積的なユーザーリスニングに基づいて週単位の楽曲レベル特徴量を構築し、まだチャートに上がらなかったが後にヒットとなった楽曲に対して「予測可能な」ラベルを定義した。
  • 10分割交差検証を用いて、オーディオ特徴量、早期採用者行動、および統合データセットを用いて複数の分類器(ロジスティック回帰、SVM、RIPPER、ナイーブベイズ、C4.5)を訓練した。
  • AUC(受信者操作特性曲線下の面積)を用いて性能を評価し、オーディオ特徴量のみ、メタ特徴量、早期採用者行動モデルについて別々の分析を行った。

実験結果

リサーチクエスチョン

  • RQ1Last.FM における早期採用者のリスニング行動は、オーディオ特徴量のみに依存するモデルよりも、将来のトップ20ダンスヒットをより正確に予測できるか?
  • RQ2ソーシャルリスニングダイナミクスを組み込むことで、従来のオーディオ特徴量ベースのモデルに比べてヒット予測性能がどのように向上するか?
  • RQ3事前に計算されたメタ特徴量(例:「ホットネス」)は予測性能にどの程度影響を及ぼすか?また、生のオーディオ特徴量のみに依存するモデルでも、強力な結果を達成できるか?
  • RQ4異なる Last.FM ユーザーグループ間で、将来のヒットを特定する予測力に顕著な差があるか?
  • RQ5オーディオとソーシャルリスニングデータを統合したモデルは、個々のモデルを上回る性能を示すか?さらにハイパーパramータチューニングによって、性能を向上させられる可能性はあるか?

主な発見

  • 早期採用者リスニング行動に基づくロジスティック回帰モデルが最高の AUC 0.79 を達成し、オーディオ特徴量のみのモデルを顕著に上回った。
  • 生の EchoNest 特徴量を用いたオーディオ特徴量のみのモデルは最大で AUC 0.64 を達成し、メタ特徴量が欠落していると予測力が限定的であることが示された。
  • メタ特徴量(例:「ホットネス」)の導入によりモデル性能は AUC 0.77 まで向上し、これらの特徴量が既にチャート成功の兆候を内蔵している可能性を示唆した。
  • 早期採用者行動に基づくモデルは、ナイーブベイズで AUC 0.70、ロジスティック回帰で AUC 0.79 を達成し、強い予測価値を示した。
  • 早期採用者モデルは複数の分類器で一貫した性能を示し、特にロジスティック回帰が最も正確であった。これは、モデル選択に対して高いロバスト性があることを示した。
  • 本研究では、ソーシャルリスニングデータがヒット潜在力のリーディングインジケーターとしての可能性を浮き彫りにした。SVM に対してもパrameterチューニングを施さなかったが、性能向上の余地があると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。