Skip to main content
QUICK REVIEW

[論文レビュー] What is missing in deep music generation? A study of repetition and structure in popular music

Shuqi Dai, Huiran Yu|arXiv (Cornell University)|Sep 1, 2022
Music and Audio Processing被引用数 5
ひとこと要約

本論文は、中国およびアメリカの音楽データセットを用いたデータ駆動型分析を通じて、ポップ音楽における構造的繰り返しを調査し、実際の楽曲が階層的繰り返しと限定された内部語彙を用いることで一貫性を生み出していることを明らかにした。また、深層音楽生成モデルがこれらの構造的特性を再現できないこと、人間が作曲した音楽よりもエントロピーが高く、繰り返しが少ないことから、現在の生成システムに顕著なギャップが存在することが示された。

ABSTRACT

Structure is one of the most essential aspects of music, and music structure is commonly indicated through repetition. However, the nature of repetition and structure in music is still not well understood, especially in the context of music generation, and much remains to be explored with Music Information Retrieval (MIR) techniques. Analyses of two popular music datasets (Chinese and American) illustrate important music construction principles: (1) structure exists at multiple hierarchical levels, (2) songs use repetition and limited vocabulary so that individual songs do not follow general statistics of song collections, (3) structure interacts with rhythm, melody, harmony, and predictability, and (4) over the course of a song, repetition is not random, but follows a general trend as revealed by cross-entropy. These and other findings offer challenges as well as opportunities for deep-learning music generation and suggest new formal music criteria and evaluation methods. Music from recent music generation systems is analyzed and compared to human-composed music in our datasets, often revealing striking differences from a structural perspective.

研究の動機と目的

  • データ駆動型分析を用いて、ポップ音楽における繰り返しと階層的構造の役割を理解すること。
  • 深層学習音楽生成モデルの出力と人間が作曲した音楽との間の構造的差を同定すること。
  • 繰り返し、語彙、エントロピーに基づいて、音楽生成の評価のための形式的で定量的な基準を策定すること。
  • 深層学習モデルがデータから自然に長期的な構造と繰り返しを学習すると仮定する考えを疑うこと。
  • 音楽情報検索(MIR)の原則に基づいた、生成音楽の構造的忠実度を評価する新しい評価手法を提案すること。

提案手法

  • 変数オーダーのマルコフモデルを用いて、中国およびアメリカのポップ音楽データセットにおけるピッチおよびリズムパターンの繰り返しを定量化し、予測可能性を分析した。
  • 曲全体にわたるピッチ系列の交差エントロピーを測定し、予測可能性の傾向を評価した。実際の音楽(POP909)と生成音楽(Music Transformer)を比較した。
  • 4小節および8小節のフレーズにおけるユニークなピッチパターンの数を数えることで語彙サイズを定量化し、実際の楽曲、ランダムサンプル、VAEで生成されたフレーズを比較した。
  • エントロピーおよび交差エントロピーの指標を用いて、音楽系列における構造的整合性と予測可能性を評価した。
  • 階層的分析を適用し、フレーズ、セクション、全曲といった複数のレベルで繰り返しを検出することで、非ランダムな繰り返しパターンを明らかにした。
  • 最先端のモデルから生成された音楽の構造的特徴と、実際の楽曲との違いを、繰り返し、語彙、予測可能性の傾向に注目して比較した。

実験結果

リサーチクエスチョン

  • RQ1ポップ音楽において、繰り返しは複数の階層的レベルでどのように構造化されているか?
  • RQ2一般的な音楽コレクションにおける統計的分布と比較して、実際の楽曲は、一貫性を生み出すためにどれほど限定された内部語彙と繰り返しを用いているか?
  • RQ3Music Transformer や VAE といった深層音楽生成モデルは、人間が作曲した音楽と比較して、繰り返し、語彙、予測可能性の観点でどの程度異なるか?
  • RQ4交差エントロピーは、曲の進行に伴い構造的傾向や予測可能性をどのように明らかにするか?
  • RQ5エントロピーおよび語彙サイズといった構造的指標は、音楽生成システムの評価基準として正式に用いることができるか?

主な発見

  • 実際のポップ音楽は強い階層的繰り返しを示しており、繰り返しはランダムではなく、時間経過とともに非一様な傾向を示し、構造的転換部で一時的に交差エントロピーが上昇する傾向がある。
  • 全体のデータセットから予想されるよりも著しく小さい内部語彙サイズを楽曲が用いることで、一貫性と個性が生み出されている。
  • Music Transformer が生成した音楽は、曲の最終30%において平均交差エントロピーが1ビット/ノート未満に低下しており、実際の音楽よりも予測がきすぎていることを示している。
  • VAE で生成されたフレーズは、実際の PDSA フレーズと比較して顕著に多くのユニークなピッチパターンを示す(p < 10^-5)、人間が作曲した音楽と比較して冗長性と一貫性が低いことを示している。
  • 曲内のフレーズは、外部のトレーニングデータよりも内部パターンを用いることでより予測可能であるため、実際の楽曲には強い不変性と内部構造的一致性があることが示された。
  • 実際の POP909 曲における交差エントロピーの傾向は、曲の20%付近および終盤で一時的に上昇しており、対照的または新規のセクションに起因すると考えられ、人間の作曲における構造的認識が示されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。