[論文レビュー] Evaluating language models of tonal harmony
本研究では、西洋共通実践調性音楽の大規模コーパスを用い、有限文脈(n-gram)および再帰的ニューラルネットワーク(RNN)言語モデルを、調性多様性を保つデータ駆動型コード表現スキームを用いてコード予測に評価した。PPMに基づく有限文脈モデルは、稀なコード種別に確率を割り当てられる能力により、特にピアノ音楽においてRNNを上回った。回帰分析により、RNNは不確実なコードに苦労することが確認された。
This study borrows and extends probabilistic language models from natural language processing to discover the syntactic properties of tonal harmony. Language models come in many shapes and sizes, but their central purpose is always the same: to predict the next event in a sequence of letters, words, notes, or chords. However, few studies employing such models have evaluated the most state-of-the-art architectures using a large-scale corpus of Western tonal music, instead preferring to use relatively small datasets containing chord annotations from contemporary genres like jazz, pop, and rock. Using symbolic representations of prominent instrumental genres from the common-practice period, this study applies a flexible, data-driven encoding scheme to (1) evaluate Finite Context (or n-gram) models and Recurrent Neural Networks (RNNs) in a chord prediction task; (2) compare predictive accuracy from the best-performing models for chord onsets from each of the selected datasets; and (3) explain differences between the two model architectures in a regression analysis. We find that Finite Context models using the Prediction by Partial Match (PPM) algorithm outperform RNNs, particularly for the piano datasets, with the regression model suggesting that RNNs struggle with particularly rare chord types.
研究の動機と目的
- 調性音楽におけるコードタイプロジックに関する事前仮定を最小限に抑える、データ駆動型で柔軟なコード表現スキームの開発。
- 共通実践期音楽の大規模コーパスにおけるコード予測に、最新の言語モデル(有限文脈(n-gram)およびRNN)を評価すること。
- 特にピアノ音楽とオchestral音楽の間で性能差が生じる要因を特定するなど、モデルアーキテクチャおよびデータセットごとの予測精度を比較すること。
- 回帰分析を用いてモデル性能の差を説明し、予測誤差の主要なコーパスレベル予測因子を同定すること。
- データ駆動型和声モデリングと専門家がアノテートしたコードタイプ論とを橋渡しし、無教師で和声的構造を発見可能にする。
提案手法
- ピッチクラス集合とスケールドメインに基づく、コードイベントを表現する柔軟でデータ駆動型のコードエンコーディングスキームを開発。スケールドメインごに200種類以上の異なるコードタイプを、事前のタイプ論的仮定なしに保持した。
- 1710年から1910年までの1,000曲の作品から成る100万以上のコードトークンを含む複合コーパスを用いた。バッハのコーラル、ベートーヴェンの四重奏曲およびピアノソナタ、ショパンのピアノ作品、ジョープリンのラグを含む。すべてのデータはMusicXMLおよびMIDI形式に変換済み。
- 有限文脈モデルは、予測のための文脈履歴を活用し、未観測または希少なコード種別に確率を割り当てる予測部分一致(PPM)アルゴリズムを用いて実装した。
- 再帰的ニューラルネットワーク(LSTM)モデルを、コード発生時系列をエンドツーエンドで学習させ、次のコードを予測するように訓練した。
- モデルの性能は、異なるデータセットおよびモデル設定における予測精度の指標として交差エントロピー損失を用いて評価した。
- 段階的回帰分析を用いて、コーパスレベルの特徴(例:語彙サイズ、トークン頻度、モノフォニックコンテンツ)がモデル性能差を予測する要因であるかを同定した。
実験結果
リサーチクエスチョン
- RQ1有限文脈(n-gram)および再帰的ニューラルネットワーク(RNN)モデルは、大規模なデータ駆動型共通実践期調性音楽コーパスにおいて、コード進行を予測する上でどのように比較されるか?
- RQ2有限文脈モデルに組み込まれたPPMアルゴリズムは、特に未観測または希少なコード種別を扱う際に、RNNよりも性能優位性を示すか?
- RQ3語彙サイズ、不確実なイベントの割合、モノフォニックイベントの割合といったコーパスレベルの特徴のうち、どの特徴がモデルアーキテクチャ全体の予測精度に最も強く影響を与えるか?
- RQ4モデル性能の差は、ピアノ音楽とオーケストラ音楽といった音楽ジャンルや楽器編成にどの程度関連しているか?
- RQ5データ駆動型コード表現スキームは、従来の専門家がアノテートしたタイプ論に比べ、より正確で汎用性の高い調性和声の言語モデリングを可能にするか?
主な発見
- PPMアルゴリズムを用いた有限文脈モデルは、特にピアノデータセットにおいて、RNNを上回るコード予測性能を示し、交差エントロピー値が著しく低かった。
- PPMが未観測または希少なコード種別にゼロでない確率を割り当てられる能力が、優れた性能の主な要因であった。回帰分析により、RNNは不確実なコード種別に苦労することが確認された。
- 有限文脈モデルでは、交差エントロピーの53%の分散が、トークン数、語彙サイズ、モノフォニックコンテンツ、不確実なイベントの4つの予測因子によって説明された。
- 一方、RNN(LSTM)では、不確実なイベントの割合が交差エントロピーに強く正の影響を与えた(β = 0.463)ことから、希少コードへの一般化能力が低いことが示された。
- RNNモデルは、短いシーケンスと小さな語彙で高い性能を示し、繰り返し隣接するトークンから利益を受けていたが、モノフォニックコンテンツや高い語彙多様性によって悪影響を受けていた。
- 回帰結果により、RNNは希少な和声的イベントのモデリングにあまり効果的でないことが確認され、調性和声の全分布にわたる一般化能力に根本的な限界があることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。