Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Harmony with Skip-Grams

David R. W. Sears, Andreas Arzt|arXiv (Cornell University)|Jul 14, 2017
Music and Audio Processing参考文献 22被引用数 14
ひとこと要約

本稿では、自然言語処理の技術であるスキップ・グラムを用いて、西洋古典音楽におけるトーン・ハーモニーをモデル化し、非連続なコード進行を捉えることでn-gram分布におけるデータのスパarsityを軽減する手法を提案する。スキップしきい値内に含まれる部分列を含めることで、従来の連続n-gramに比べて、定型的な cadence(cadence)のカバレッジが著しく向上し、レアn-gramの割合が低下する。特に3-gramおよび4-gramのパターン発見タスクにおいて、連続n-gramを上回る性能を示す。

ABSTRACT

String-based (or viewpoint) models of tonal harmony often struggle with data sparsity in pattern discovery and prediction tasks, particularly when modeling composite events like triads and seventh chords, since the number of distinct n-note combinations in polyphonic textures is potentially enormous. To address this problem, this study examines the efficacy of skip-grams in music research, an alternative viewpoint method developed in corpus linguistics and natural language processing that includes sub-sequences of n events (or n-grams) in a frequency distribution if their constituent members occur within a certain number of skips. Using a corpus consisting of four datasets of Western classical music in symbolic form, we found that including skip-grams reduces data sparsity in n-gram distributions by (1) minimizing the proportion of n-grams with negligible counts, and (2) increasing the coverage of contiguous n-grams in a test corpus. What is more, skip-grams significantly outperformed contiguous n-grams in discovering conventional closing progressions (called cadences).

研究の動機と目的

  • n-gramモデルにおけるトーン・ハーモニーのデータスパarsity、特に3-gramや4-gramといった高次進化形に対して解決を図ること。
  • 音楽モデリングにおける連続性の誤謬(contiguity fallacy)を克服すること。これは、非コード音が挟まるために非連続なイベント(例:cadence)が見逃されてしまう現象である。
  • スキップ・グラムが、連続n-gram分布に存在しないが構造的に重要な繰り返しのハーモニック・パターン(例:完全 authentic cadence)を回復できるかどうかを評価すること。
  • 非隣接だが構造的に重要なコードイベントをモデル化することで、記号的音楽コーパスにおけるパターン発見および予測性能を向上させること。

提案手法

  • 本研究では、ボイス・リーディング・タイプ(VLT)を用いて、最適に簡略化されたコードタイプロジックを構築し、コードを基底音からの半音数(12を法とする)で表現する。
  • スキップ・グラムは、n個のコードイベントの部分列として定義され、その構成要素が固定または可変の時間的スキップ(t)の範囲内に存在する場合に限り、非連続なイベントもn-gram分布に含める。
  • 2種類のスキップ条件を評価した:固定スキップ(例:t=2)および可変スキップ(例:t=2秒のオフセット間隔)。両者とも2-gram、3-gram、4-gramに適用された。
  • 本手法は、4つの記号的西洋古典音楽コーパスを用いてテストされ、VLTエンコーディングによりデータセット間でのコード表現を標準化した。
  • カバレッジとスパarsity指標は、レアn-gramの割合と、スキップ・グラムモデルがテストセットの連続n-gramをどれだけ回復できるかを比較することで算出された。
  • 本手法は計算的に実行可能であり、コンsumerハードウェアを用いた1,000コードのシーケンスにおいて、4-gram抽出の実行時間が100ms未満であった。

実験結果

リサーチクエスチョン

  • RQ1スキップ・グラムは、顕著な頻度が低いn-gramの割合を最小限に抑えることで、トーン・ハーモニーのn-gram分布におけるデータスパarsityを軽減できるか?
  • RQ2スキップ・グラムは、連続n-gramに比べて、テストコーパスにおける連続n-gramのカバレッジをどの程度向上させるか?
  • RQ3スキップ・グラムは、表面的には連続していないが構造的に存在する定型的なハーモニック進行(例:cadence)を効果的に回復できるか?
  • RQ4スキップ・グラムによる非連続イベントの組み込みが、sempliceおよびcomp机构成のcadenceといった繰り返しのハーモニックパターンの検出にどのように影響を与えるか?

主な発見

  • 3-gramでは、顕著な頻度が低いn-gramの割合が、連続モデルの42.5%から固定スキップの21.8%、可変スキップの18.7%にまで低下し、スパarsityが顕著に軽減された。
  • テストセットにおける連続3-gramのカバレッジは、連続モデルの59.2%から固定スキップの84.1%、可変スキップの88.3%に向上し、ゼロ頻度問題が緩和された。
  • 4-gramでは、連続n-gramのカバレッジが、連続モデルの36.5%から固定スキップの71.1%、可変スキップの82.4%に上昇し、構造的パターンの強力な回復が示された。
  • semplice cadence(I⁶–ii⁶–V⁷–I)は、スキップ・グラムを用いた場合、245曲中32曲で検出されたが、連続モデルではゼロだった。一方、comp机构成のcadence(ii⁶–“I⁶₄”–V⁷–I)は、スキップ・グラムで77曲、連続モデルではたった7曲で検出された。
  • 本手法により、n<5におけるパワー・ロウの頻度ランク関係が回復され、これは連続n-gram分布で失われていた統計的頑健性を示している。
  • 実行時間の観点からも実用的であった:1,000コードのシーケンスにおいて、固定スキップ条件では4-gram抽出が100ms未満、可変スキップ条件では3秒未満で実行された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。