[論文レビュー] Learning Audio Embeddings with User Listening Data for Content-based Music Recommendation
本稿では、ユーザーの再生履歴と人口統計データを組み合わせ、シアン型ネットワークを用いたメトリック学習により音声埋め込み(AE)を学習する二重ブランチモデルを提案する。ユーザー埋め込みをアンカーとして用い、好ましい/好ましくないトラックペアを学習することで、コンテンツベースのAEを生成し、音楽推薦(正確度:0.773、AUC:0.849)で最先端の性能を達成するとともに、ジャンル分類の精度も向上させた。
Personalized recommendation on new track releases has always been a challenging problem in the music industry. To combat this problem, we first explore user listening history and demographics to construct a user embedding representing the user's music preference. With the user embedding and audio data from user's liked and disliked tracks, an audio embedding can be obtained for each track using metric learning with Siamese networks. For a new track, we can decide the best group of users to recommend by computing the similarity between the track's audio embedding and different user embeddings, respectively. The proposed system yields state-of-the-art performance on content-based music recommendation tested with millions of users and tracks. Also, we extract audio embeddings as features for music genre classification tasks. The results show the generalization ability of our audio embeddings.
研究の動機と目的
- 新規リリースの楽曲に対するコールドスタート問題を、音声およびユーザーのデータを活用することで解決すること。
- 再生履歴と人口統計的特徴をユーザー埋め込みに統合することで、ユーザーの好みのモデリングを向上させること。
- ユーザー埋め込みをアンカーとして用いるメトリック学習フレームワークを構築し、音声コンテンツから判別性の高い音声埋め込みを学習すること。
- 学習された音声埋め込みの一般化性能を、音楽推薦およびジャンル分類のタスクにおいて評価すること。
- ユーザーに anchored されたメトリック学習が、音声のみのベースラインと比較してより効果的な音声表現をもたらすことを示すこと。
提案手法
- 再生履歴と人口統計データから40次元のユーザー埋め込み(UE)を生成するため、YouTubeDNNにインspiredされたアーキテクチャを用いたユーザーブランチを訓練する。
- 明示的および暗黙的フィードバック(例:プレイリストへの追加)をユーザーブランチの監視に用い、分類のための交差エントロピー損失を適用する。
- 好ましいトラックと好ましくないトラックの音声埋め込みを比較するために、重みを共有する2つのタワーを持つシアン型ネットワークを音声ブランチに実装する。
- ログメルスペクトログ램をシアン型CNNに供給し、各畳み込み層の後にReLU活性化関数を適用し、40次元の出力を音声埋め込みとして得る。
- トリプレット損失(対照的損失)を用いたメトリック学習を実施し、好ましいトラックの埋め込みをユーザー埋め込みに近づけ、好ましくないものを遠ざけるように最適化する。
- 大規模なユーザー・トラック相互作用データ上でシアン型ネットワークを効率的に最適化するため、トレーニング中にネガティブサンプリングを適用する。
実験結果
リサーチクエスチョン
- RQ1包括的な再生履歴と人口統計データから導出されるユーザー埋め込みが、コンテンツベースの推薦のための音声埋め込みの質を向上させることができるか?
- RQ2メトリック学習においてユーザー埋め込みをアンカーとして用いることで、音声のみの学習と比較して音声埋め込みの判別力が向上するか?
- RQ3学習された音声埋め込みは、音楽ジャンル分類などの下流タスクにどの程度一般化できるか?
- RQ4コンテキスト窓の長さ(例:10秒)が音声埋め込みモデルの性能に与える影響は何か?
- RQ5提案されたモデルは、音楽推薦およびジャンル分類の両方で、既存の最先端手法を上回ることができるか?
主な発見
- 本モデルは、6000万件のユーザー・トラック相互作用を含む大規模データセット上で、正確度0.773、AUC 0.849を達成し、ベースラインモデルを上回った。
- ジャンル分類において、SVMの精度はGTZANデータセットでAEなしの0.7653から0.8013に向上し、FMA-smallでは0.5918から0.6148に向上した。
- MIREX 2020 ジャンル分類タスクでは、平均精度0.7474を達成し、カントリー、ラップ/ヒップホップ、Kポップバラードのジャンル分類で最高の性能を示した。
- コンテキスト窓を10秒に延長することで、正確度とAUCの両方が向上し、より長い音声コンテキストが埋め込みの質を向上させることを示した。
- ユーザーに anchored されたメトリック学習により学習された音声埋め込みは、推薦および分類タスクの両方で良好に一般化され、強力な転送性を示した。
- モデルの性能は多様な音楽ジャンルにわたり安定しており、特にKポップおよびラップ/ヒップホップで特に優れた結果を示し、ジャンル固有の音声パターンに敏感であることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。