Skip to main content
QUICK REVIEW

[論文レビュー] A Predictive Model for Music Based on Learned Interval Representations

Stefan Lattner, Maarten Grachten|arXiv (Cornell University)|Jun 22, 2018
Music and Audio Processing参考文献 11被引用数 17
ひとこと要約

本稿では、絶対音高ではなく相対的音程間隔を学習する順序モデルである再帰的ゲーテッドオートエンコーダー(RGAE)を提案する。これにより、一般化性能が向上し、音楽的繰り返しや移調の明示的モデリングが可能になる。RGAEは、区間空間におけるコピーオペレーションとシフト操作を学習することで、移調された音楽的繰り返しの予測において平均99.43%の精度を達成し、標準的なRNNを著しく上回る。

ABSTRACT

Connectionist sequence models (e.g., RNNs) applied to musical sequences suffer from two known problems: First, they have strictly "absolute pitch perception". Therefore, they fail to generalize over musical concepts which are commonly perceived in terms of relative distances between pitches (e.g., melodies, scale types, modes, cadences, or chord types). Second, they fall short of capturing the concepts of repetition and musical form. In this paper we introduce the recurrent gated autoencoder (RGAE), a recurrent neural network which learns and operates on interval representations of musical sequences. The relative pitch modeling increases generalization and reduces sparsity in the input data. Furthermore, it can learn sequences of copy-and-shift operations (i.e. chromatically transposed copies of musical fragments)---a promising capability for learning musical repetition structure. We show that the RGAE improves the state of the art for general connectionist sequence models in learning to predict monophonic melodies, and that ensembles of relative and absolute music processing models improve the results appreciably. Furthermore, we show that the relative pitch processing of the RGAE naturally facilitates the learning and the generation of sequences of copy-and-shift operations, wherefore the RGAE greatly outperforms a common absolute pitch recurrent neural network on this task.

研究の動機と目的

  • 音楽理論の根幹をなす相対的音高関係をモデル化する点で、絶対音高表現によっては十分に捉えられていない標準RNNの限界に対処すること。
  • 絶対音高の代わりに区間表現を学習することで、音楽系列モデリングにおけるデータスパarsityと一般化性能の低さを克服すること。
  • 音楽的構造にとって不可欠であるが、標準RNNではしばしば見過ごされる、音楽的繰り返しと移調された繰り返し(コピーオペレーションとシフト)の明示的モデリングを可能にすること。
  • RGAEによる相対的音高処理が絶対音高モデルと補完的であることを示し、アンサンブル手法によって全体の予測精度を向上させること。
  • 特定の音楽的テクスチャに依存せずに、複雑な構造スキーム(移調された繰り返しの抽象的系列)を学習・生成できることを示すこと。

提案手法

  • 入力音高間の区間表現を学習するゲーテッドオートエンコーダー(GAE)を用い、絶対音高系列を潜在空間における相対的区間表現に変換する。
  • 学習された区間表現を用いて再帰的ニューラルネットワーク(RNN)を適用し、音楽における時間的依存性と長距離構造をモデル化する。
  • モノフォニックメロディーの次の音を予測するためのカテゴリカル交差エントロピー損失を用いて、生成的系列モデルとしてエンドツーエンドに訓練する。
  • 絶対音高ではなく区間で処理することで、移調不変性を実現し、データスパarsityとモデルの複雑さを低減する。
  • 時間遅延における一定の区間の繰り返し応用として、コピーオペレーションとシフト操作の系列を学習可能にする。
  • 絶対音高RNNの予測とRGAEの予測をアンサンブル平均で統合することで、全体の予測精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1区間表現を学習する系列モデルは、モノフォニックメロディー予測タスクにおいて、標準RNNよりも一般化性能が優れているか?
  • RQ2区間ベースのモデリングは、音楽における移調された繰り返し(コピーオペレーションとシフト)の学習と生成をどの程度向上できるか?
  • RQ3予測の安定性と一般化性能という観点から、RGAEによる相対的音高処理は、絶対音高モデリングと比べてどう異なるか?
  • RQ4RGAEは、それらを実現するための具体的な音楽的テクスチャに依存せずに、抽象的な音楽的構造スキームを学習・表現できるか?
  • RQ5相対的音高(RGAE)と絶対音高(RNN)のモデルを組み合わせることで、単独で使用する場合よりも、音楽系列予測の性能が向上するか?

主な発見

  • RGAEは、移調された音楽的繰り返しの予測において平均99.43%の精度を達成し、全系列の92%が99%以上の精度で正しく継続された。
  • RGAEの交差エントロピー損失は0.16であり、RNNの損失10.10と比べて2桁低いことから、予測の信頼性と適合度が著しく優れていることが示された。
  • コピーオペレーションとシフトタスクにおいて、RNNが41.38%の平均精度にとどまる中、RGAEは大幅に優れた性能を示し、区間ベース学習の利点が顕著に現れた。
  • RGAEの隠れユニット活性化は、特定の音楽的テクスチャではなく抽象的構造スキームに注目していることを示し、より規則的かつコンテンツ不変であった。
  • RGAEは、訓練時に見未曾る新しいメロディーに対しても、{-4,+8,-4,+8,...}などの構造スキームを学習し、一般化できることを示した。
  • RGAEと絶対音高RNNのアンサンブルにより、予測精度がさらに向上し、相対的音高と絶対音高モデリングが補完的であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。