Skip to main content
QUICK REVIEW

[論文レビュー] Embeddings as representation for symbolic music

Sebastian Garcia-Valencia|arXiv (Cornell University)|May 19, 2020
Music and Audio Processing参考文献 9被引用数 5
ひとこと要約

本論文では、シンボリック音楽を表現するためのニューラルネットワーク埋め込みを提案し、学習されたベクトル表現がオクターブ等価性、インターバル類似性、ピッチクラス関係といった意味的な音楽的関係を捉えていることを示している。t-SNEで可視化した結果、ノートベースとインターバルベースの表現から得られる埋め込みは、音楽的意味に一致する構造的なクラスタを示しており、モデルのアーキテクチャを変更せずに埋め込みが内蔵された音楽的知識をエンコードしていることが示された。

ABSTRACT

A representation technique that allows encoding music in a way that contains musical meaning would improve the results of any model trained for computer music tasks like generation of melodies and harmonies of better quality. The field of natural language processing has done a lot of work in finding a way to capture the semantic meaning of words and sentences, and word embeddings have successfully shown the capabilities for such a task. In this paper, we experiment with embeddings to represent musical notes from 3 different variations of a dataset and analyze if the model can capture useful musical patterns. To do this, the resulting embeddings are visualized in projections using the t-SNE technique.

研究の動機と目的

  • 自然言語処理(NLP)における単語埋め込み技術が、意味的な意味を有するシンボリック音楽を表現するために適応可能かどうかを調査すること。
  • 学習された埋め込みが、オクターブ関係やインターバル類似性といった音楽的に関連するパターンを捉えられるかどうかを評価すること。
  • 原始的なノート、トランスポジションされたノート、およびインターバル列といった、異なるデータ表現が、ベクトル空間における音楽的構造をどの程度エンコードできるかを比較すること。
  • トランポジションによるデータ拡張が、埋め込みの品質および意味的クラスタリングに与える影響を評価すること。

提案手法

  • 128次元の埋め込み層を備えた一方向LSTMベースのモデルを訓練し、音符およびインターバルの表現を学習した。
  • 3つのデータバージョンを用いた:(1) 原始MIDIノート(コントロールデータセット)、(2) 12のトロニティティにわたるトランスポジション版(DB12)、(3) 連続するノート間の相対半音インターバル。
  • t-SNEを用いて、高次元埋め込み(128次元)を2次元および3次元に射影し、パターン分析のための可視化を行った。
  • 埋め込み空間内の最近傍探索を実施し、意味的類似性およびクラスタリング行動を評価した。
  • ベクトル空間内での埋め込み間の近接性を測るためにコサイン類似度を用いた。
  • TensorBoardを用いて可視化し、埋め込み内のクラスターや構造的パターンを解釈した。

実験結果

リサーチクエスチョン

  • RQ1学習された埋め込みは、シンボリック音楽においてオクターブ等価性やインターバル類似性といった音楽的に意味的な関係を捉えられるか?
  • RQ2トランポジションによるデータ拡張は、埋め込みの構造およびクラスタリングにどのような影響を及ぼすか?
  • RQ3インターバルベースの表現は、ノートベースの表現よりもより一貫性のある意味的グルーピングをもたらすか?
  • RQ4t-SNEの可視化は、高次元埋め込み空間内に解釈可能な音楽的パターンを明らかにできるか?

主な発見

  • DB12データセット(トランポジションあり)で学習した埋め込みは、同じノートが複数オクターブにわたって(例:C4、C6、C8)最近傍として配置され、オクターブ等価性が学習されたことを示している。
  • コントロールデータセットでは、中央ド(C5)の最近傍が複数のオクターブにわたる(例:E10、C9、E9)ため、データ拡張なしでは構造的でないクラスタリングが示された。
  • インターバルベースの埋め込みモデルでは、マイナースケール3度(3)、マイナースケール2度(1)、完全4度(5)といった半音が密接にクラスタリングされており、インターバル空間内での意味的類似性が示された。
  • DB12データセットは12倍のサイズであったが、学習された固有の埋め込みはわずか118個にとどまり、トランポジションにより等価なピッチクラスに対して重複する表現が生じたことが示された。
  • t-SNEの可視化により、低音、中音、高音、変化音のクラスタが明確に分離されており、埋め込みがピッチレンジとフラット・シャープを意味的特徴としてエンコードしていることが確認された。
  • マイナースケール3度(3)の最近傍には、ユニゾン(0)、マイナースケール2度(1)、マジョルト2度(2)、完全4度(5)といった共通するインターバルが含まれており、埋め込み空間内にインターバルの意味的構造が保持されていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。